MMLU
Раньше нейросети тестировали по узким задачам вроде перевода. Но современные модели претендуют на универсальность, и MMLU имитирует «экзамен на эрудицию»: вопрос про квантовую механику, затем про налоги. Высокий балл означает, что модель может рассуждать в разных областях, извлекать факты и применять логику.
Устройство простое: как студент, сдающий ЕГЭ по десятку предметов, модель получает вопросы с четырьмя вариантами ответов. Никаких подсказок и доступа в интернет. Нужно не только помнить факты, но и понимать формулировки: например, что «ядро клетки» — это не «центральный процессор». Система сравнивает ответ с правильным.
Прикладной пример: если ИИ-помощник набрал высокий балл в разделе по биологии, это сильный сигнал, что его объяснения про митоз будут точными, а не «красивой фантазией». Разработчики специально прогоняют модели через MMLU, чтобы отсеивать ошибки до релиза.
В итоге MMLU — своего рода «школьный аттестат» для ИИ. Он не идеален: возможны угадывания и спорные данные. Но именно этот тест стал стандартным инструментом сравнения систем и позволяет спокойнее доверять ИИ в разных сферах.
Поделиться