MedQA
Как это работает: ИИ выступает студентом, а MedQA — итоговым тестом. Модель получает описание пациента: жалобы, анализы, возраст — и должна выбрать один верный ответ из пяти: диагноз или исследование. Вопросы публичны, поэтому заучивание не помогает; нужно строить логические цепочки: сопоставлять симптомы, отсеивать варианты, вспоминать похожие случаи. Результат — процент совпадений с экспертной комиссией. Это грубо, но наглядно.
Пример: передовая языковая модель, блестяще пишущая эссе, набрала на MedQA лишь чуть больше половины правильных ответов — тревожный сигнал: за речью скрывается неумение замечать нюансы анализов. После дообучения на обезличенных историях болезней результат вырос до уровня практикующего врача. Так тест показывает, какие системы можно допускать к черновой работе в клинике.
Вывод: MedQA — лакмусовая бумажка для медицинского ИИ. Он не делает систему врачом, но честно вскрывает пробелы в знаниях. Пока такие тесты не пройдены достойно, об автономных диагнозах говорить рано. За этим термином — безопасность живых людей.
Поделиться