Desempenho de modelos de IA no raciocínio clínico farmacêutico: análise de questões simuladas sobre consistência, segurança e clareza
DOI:
https://doi.org/10.22491/2357-9730.155747Palavras-chave:
Inteligência Artificial Generativa, Segurança do Paciente, Raciocínio ClínicoResumo
CONTEXTO: Os modelos de linguagem natural, amplamente conhecidos e de acesso livre, destacam-se por suas interfaces simplificadas e pelo uso disseminado na prática diária por profissionais e leigos, gerando respostas rápidas com base em grandes volumes de dados. No entanto, uma limitação é que eles também extraem dados da literatura cinzenta. Neste trabalho, avaliamos o desempenho de três modelos de IA (ChatGPT, Copilot e Gemini) na resolução de questões clínicas simuladas, considerando três domínios: consistência, segurança e clareza das respostas. MÉTODO: Este estudo exploratório, descritivo e comparativo incluiu 15 questões clínicas simuladas, categorizadas por nível de dificuldade (baixa, moderada e alta complexidade). Cada IA respondeu às mesmas questões, e as pontuações foram atribuídas por avaliadores especialistas nos três domínios de interesse. RESULTADOS: No geral, não houve diferenças estatisticamente significativas entre os três modelos em relação à consistência, segurança ou clareza (p > 0,05), indicando um desempenho geral equivalente. Todos os modelos apresentaram melhor desempenho em questões de baixa complexidade, com destaque para o Copilot (87,5% de consistência) e o ChatGPT (100% de segurança). Em questões de complexidade moderada, o Copilot obteve os melhores resultados (80,95% de consistência, 88,10% de segurança e 82,54% de clareza). No entanto, a análise estatística confirmou que a complexidade afeta significativamente a segurança (p = 0,0028). Quando as questões passaram do nível baixo para o nível alto de dificuldade, a capacidade das IAs de dar respostas seguras despencou de forma estatisticamente comprovada. Em questões de alta complexidade, o desempenho diminuiu acentuadamente, especialmente para o ChatGPT (50% de consistência e 54,17% de segurança). O Gemini demonstrou maior estabilidade nesse grupo, com 66,67% de consistência, 70,83% de segurança e 83,33% de clareza. O Copilot foi a única IA a fornecer uma resposta completamente correta em uma questão de alta complexidade. CONCLUSÃO: Corroboramos que a IA pode ser uma aliada do farmacêutico clínico, especialmente como suporte técnico para intervenções padronizadas. No entanto, os riscos de segurança comprovados estatisticamente em cenários de alta complexidade reforçam que ela não substitui o papel crítico e interpretativo do profissional humano. O uso dessas ferramentas deve ser considerado complementar ao raciocínio clínico.
Downloads
Publicado
Como Citar
Edição
Seção
Categorias
Licença
Copyright (c) 2026 Josué Guilherme Lisbôa Moura, Maria Gabriela Borges Hermes, Josiele Dias da Rosa Mossmann, Lauren Feiffer Sanches

Este trabalho está licenciado sob uma licença Creative Commons Attribution 4.0 International License.
Autores que publicam nesta revista concordam com os seguintes termos:
- Autores mantém os direitos autorais e concedem à revista o direito de primeira publicação, com o trabalho simultaneamente licenciado sob a Licença Creative Commons Attribution que permite o compartilhamento do trabalho com reconhecimento da autoria e publicação inicial nesta revista.
- Autores têm autorização para assumir contratos adicionais separadamente, para distribuição não-exclusiva da versão do trabalho publicada nesta revista (ex.: publicar em repositório institucional ou como capítulo de livro), com reconhecimento de autoria e publicação inicial nesta revista.
- Autores têm permissão e são estimulados a publicar e distribuir seu trabalho online (ex.: em repositórios institucionais ou na sua página pessoal) a qualquer ponto antes ou durante o processo editorial, já que isso pode gerar alterações produtivas, bem como aumentar o impacto e a citação do trabalho publicado (Veja O Efeito do Acesso Livre).