Новая модель от Anthropic продемонстрировала результат 68,8% на бенчмарке ARC-AGI-2 — тесте абстрактного мышления, в то время как год назад все ИИ показывали нулевые результаты, а средний балл среди 400 людей составлял 60%. Стоимость выполнения задачи составляет $3,64 и результаты были подтверждены командой ARC Prize на полуприватном наборе задач. ARC-AGI-2, разработанный Франсуа Шолле в марте 2025 года, проверяет не знания моделей, а их способность обобщать, решая визуальные головоломки, не позволяющие заучивать ответы. Команда тестировала Opus 4.6 с фиксированным бюджетом мышления в 120 тысяч токенов, и результаты варьировались от 63% до 68,8%. Для сравнения, предшествующая версия Opus 4.5 с меньшим бюджетом показала лишь 37,6%. Несмотря на высокие результаты, победный приз в $700 тысяч по-прежнему остается неразделенным, и команда ARC Prize объявила 2025 год «годом циклов уточнения». В начале 2026 года планируется запуск нового теста ARC-AGI-3 с интерактивными средами, требующими нового подхода.
Понравилась статья? Поделиться с друзьями:
Вам также может быть интересно
На курсах косметолога с нуля изучают четыре базовых блока: строение и физиологию кожи, санитарно-эпидемиологический
Самый быстрый бесплатный способ — вставить текст в онлайн-сервис проверки орфографии и пунктуации, а
Доход косметолога считается по простой формуле: средний чек умножается на количество процедур за месяц,
Выбирать детектив стоит не по обложке и не по рейтингу, а по типу удовольствия,
Начните с честной диагностики: пройдите пробный вариант с сайта ФИПИ и определите уровень по
Прямой ответ: службу каталога на Linux строят на FreeIPA (или производных от неё продуктах),
