GSM8K
Бенчмарк нужен потому, что простые модели часто «заучивают» ответы, а не считают. Они могут блестяще пересказывать энциклопедии, но путаются в двух действиях арифметики. GSM8K проверяет именно рассуждения: если модель решает 80% таких задач, значит, она строит логическую цепочку, а не подбирает слова по вероятности. Это важно для практических задач — от налогов до планирования поездки.
Ключевой приём, открытый на этом наборе, — «цепочка рассуждений». Если заставить нейросеть проговаривать шаги решения вслух: «Сначала узнаем, сколько у Пети. К 3 прибавляем 2, будет 5. Теперь у Маши и Пети вместе 8. Ваня съел половину — осталось 4», — точность резко растёт. Модель на каждом шаге опирается на предыдущий результат, как школьник на контрольной.
Прикладной пример: планирование бюджета на неделю. Без GSM8K модель может выдать красивый текст, но потерять счёт. После тренировки она корректно складывает расходы, вычитает скидку и делит остаток на дни — именно ту логику, что проверяется задачами об яблоках.
В итоге GSM8K — это фильтр, отделяющий «болтающие» нейросети от моделей, которые умеют думать по шагам. Пусть задачи простые, но их решение стало базовым навыком для всех современных ассистентов, претендующих на звание умных.
Поделиться