Модель Anthropic демонстрирует высокие результаты на тесте ARC-AGI-2

Новая модель от Anthropic продемонстрировала результат 68,8% на бенчмарке ARC-AGI-2 — тесте абстрактного мышления, в то время как год назад все ИИ показывали нулевые результаты, а средний балл среди 400 людей составлял 60%. Стоимость выполнения задачи составляет $3,64 и результаты были подтверждены командой ARC Prize на полуприватном наборе задач. ARC-AGI-2, разработанный Франсуа Шолле в марте 2025 года, проверяет не знания моделей, а их способность обобщать, решая визуальные головоломки, не позволяющие заучивать ответы. Команда тестировала Opus 4.6 с фиксированным бюджетом мышления в 120 тысяч токенов, и результаты варьировались от 63% до 68,8%. Для сравнения, предшествующая версия Opus 4.5 с меньшим бюджетом показала лишь 37,6%. Несмотря на высокие результаты, победный приз в $700 тысяч по-прежнему остается неразделенным, и команда ARC Prize объявила 2025 год «годом циклов уточнения». В начале 2026 года планируется запуск нового теста ARC-AGI-3 с интерактивными средами, требующими нового подхода.

Понравилась статья? Поделиться с друзьями:
Сайт для студентов