Desempenho de modelos de IA no raciocínio clínico farmacêutico: análise de questões simuladas sobre consistência, segurança e clareza

Autores

DOI:

https://doi.org/10.22491/2357-9730.155747

Palavras-chave:

Inteligência Artificial Generativa, Segurança do Paciente, Raciocínio Clínico

Resumo

CONTEXTO: Os modelos de linguagem natural, amplamente conhecidos e de acesso livre, destacam-se por suas interfaces simplificadas e pelo uso disseminado na prática diária por profissionais e leigos, gerando respostas rápidas com base em grandes volumes de dados. No entanto, uma limitação é que eles também extraem dados da literatura cinzenta. Neste trabalho, avaliamos o desempenho de três modelos de IA (ChatGPT, Copilot e Gemini) na resolução de questões clínicas simuladas, considerando três domínios: consistência, segurança e clareza das respostas. MÉTODO: Este estudo exploratório, descritivo e comparativo incluiu 15 questões clínicas simuladas, categorizadas por nível de dificuldade (baixa, moderada e alta complexidade). Cada IA ​​respondeu às mesmas questões, e as pontuações foram atribuídas por avaliadores especialistas nos três domínios de interesse. RESULTADOS: No geral, não houve diferenças estatisticamente significativas entre os três modelos em relação à consistência, segurança ou clareza (p > 0,05), indicando um desempenho geral equivalente. Todos os modelos apresentaram melhor desempenho em questões de baixa complexidade, com destaque para o Copilot (87,5% de consistência) e o ChatGPT (100% de segurança). Em questões de complexidade moderada, o Copilot obteve os melhores resultados (80,95% de consistência, 88,10% de segurança e 82,54% de clareza). No entanto, a análise estatística confirmou que a complexidade afeta significativamente a segurança (p = 0,0028). Quando as questões passaram do nível baixo para o nível alto de dificuldade, a capacidade das IAs de dar respostas seguras despencou de forma estatisticamente comprovada. Em questões de alta complexidade, o desempenho diminuiu acentuadamente, especialmente para o ChatGPT (50% de consistência e 54,17% de segurança). O Gemini demonstrou maior estabilidade nesse grupo, com 66,67% de consistência, 70,83% de segurança e 83,33% de clareza. O Copilot foi a única IA a fornecer uma resposta completamente correta em uma questão de alta complexidade. CONCLUSÃO: Corroboramos que a IA pode ser uma aliada do farmacêutico clínico, especialmente como suporte técnico para intervenções padronizadas. No entanto, os riscos de segurança comprovados estatisticamente em cenários de alta complexidade reforçam que ela não substitui o papel crítico e interpretativo do profissional humano. O uso dessas ferramentas deve ser considerado complementar ao raciocínio clínico.

Downloads

Não há dados estatísticos.

Downloads

Publicado

09-10-2026

Como Citar

1.
Lisbôa Moura JG, Hermes MGB, Mossmann JD da R, Sanches LF. Desempenho de modelos de IA no raciocínio clínico farmacêutico: análise de questões simuladas sobre consistência, segurança e clareza. Clin Biomed Res [Internet]. 9º de outubro de 2026 [citado 10º de outubro de 2026];46. Disponível em: https://seer.ufrgs.br/index.php/hcpa/article/view/155747

Edição

Seção

Artigos Originais

Categorias

Artigos Semelhantes

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 > >> 

Você também pode iniciar uma pesquisa avançada por similaridade para este artigo.