LegalBench
Зачем это важно? Юриспруденция требует точности, понимания контекста и формальной логики. Обычные бенчмарки, например викторины с фактами, не показывают, способен ли ИИ реально работать с законами, где ошибка может стоить очень дорого. LegalBench даёт исследователям общий язык: с его помощью можно сравнивать разные модели и честно видеть их слабые места в правовой сфере.
Как это работает на интуитивном уровне? Представьте экзамен, который сдаёт машина вместо студента-юриста. Задачи разбиты по типам: прочитать пункт договора и ответить, какие обязательства он накладывает; выбрать подходящую норму для случая; определить, соответствует ли документ требованиям регулирующего органа. Ответы оцениваются автоматически по заранее заданным эталонам, как в тесте с выбором варианта или с коротким ответом. Это не эссе, а чёткие проверяемые действия.
Прикладной пример: небольшой стартап разрабатывает ИИ-ассистента для проверки пользовательских соглашений. Модель, прошедшая LegalBench, может найти в документе рискованные формулировки, не соответствующие законодательству о персональных данных, и подсветить их для человека. Юрист получает список подозрительных пунктов, а не читает весь текст с нуля. Экономит часы работы, но ответственность остаётся на специалисте.
Вывод: LegalBench — это не просто экзамен, а ориентир для создателей и покупателей ИИ. Он показывает, насколько модель понимает правовой язык и может применяться в юридической практике — с осторожностью и под контролем профессионалов.
Поделиться