Categorias
Tecnologia

GPT-4 teve desempenho próximo ao nível de médicos especialistas em avaliações oftalmológicas

[ad_1]

À medida que os modelos de aprendizagem de línguas (LLMs) continuam a avançar, também avançam as questões sobre como podem beneficiar a sociedade em áreas como a área médica. A estudo recente da Escola de Medicina Clínica da Universidade de Cambridge descobriu que o GPT-4 da OpenAI teve um desempenho quase tão bom em uma avaliação oftalmológica quanto os especialistas na área, o Tempos Financeiros relatado pela primeira vez.

No estudo, publicado em PLOS Saúde Digitalos pesquisadores testaram o LLM, seu antecessor GPT-3.5PaLM 2 do Google e LLaMA da Meta com 87 questões de múltipla escolha. Cinco oftalmologistas especialistas, três oftalmologistas estagiários e dois médicos juniores não especializados receberam o mesmo exame simulado. As perguntas vieram de um livro para testar os estagiários sobre tudo, desde sensibilidade à luz até lesões. Os conteúdos não estão disponíveis publicamente, então os pesquisadores acreditam que os LLMs não poderiam ter sido treinados neles anteriormente. O ChatGPT, equipado com GPT-4 ou GPT-3.5, teve três chances de resposta definitiva ou sua resposta foi marcada como nula.

GPT-4 pontuaram mais alto que os estagiários e médicos juniores, acertando 60 das 87 questões. Embora este valor tenha sido significativamente superior à média de 37 respostas corretas dos médicos juniores, apenas superou a média dos três estagiários de 59,7. Enquanto um oftalmologista especialista respondeu com precisão apenas 56 perguntas, os cinco tiveram uma pontuação média de 66,4 respostas certas, superando a máquina. PaLM 2 marcou 49 e GPT-3.5 marcou 42. LLaMa teve a pontuação mais baixa, 28, ficando abaixo dos médicos juniores. Notavelmente, esses ensaios ocorreram em meados de 2023.

Embora esses resultados tenham benefícios potenciais, também existem alguns riscos e preocupações. Os investigadores observaram que o estudo ofereceu um número limitado de perguntas, especialmente em certas categorias, o que significa que os resultados reais podem ser variados. LLMs também têm uma tendência a “alucinar“ou inventar coisas. Isso é uma coisa se for um fato irrelevante, mas afirmar que há catarata ou câncer é outra história. Como é o caso em muitos casos de uso de LLM, os sistemas também carecem de nuances, criando mais oportunidades para imprecisões.

[ad_2]

Fonte:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *