Модель на 27 млрд параметров обошла флагманы ИИ на ARC-AGI-3
Первый контрольный рубеж ARC-AGI-3 от ARC Prize, подведённый в начале июля, достался не флагманской лаборатории, а небольшой открытой модели с Python REPL. Разрыв оказался минимальным — в этом и смысл теста.

6 июля 2026 года ARC Prize объявил результаты первого контрольного рубежа ARC-AGI-3 — конкурсный период закрылся 30 июня. Первое место и 25 000 долларов получила Tufa Labs за систему Duck harness на базе Qwen 3.6 27B, запущенной локально, а не на какой-либо флагманской проприетарной модели. Второе место (10 000 долларов) досталось решению Reki, третье (2 500 долларов) — участнику Md Boktiar Mahbub Murad с системой forge. Условием приза для всех троих было открыть исходный код своих харнессов.
ARC-AGI-3 спроектирован так, чтобы противостоять грубому сопоставлению паттернов, которое подорвало ценность более ранних версий ARC. Если ARC-AGI-2 предлагал статичные головоломки, то ARC-AGI-3 помещает агента в игровую среду без каких-либо инструкций: сначала нужно понять правила через исследование, построить рабочую модель среды по итогам этого исследования, самому определить цель — и только потом планировать и действовать. Оценка на лидерборде Kaggle идёт на одном GPU на заявку, что ограничивает объём вычислений, который участник может бросить на задачу.
Именно это ограничение объясняет форму победившего решения. В Duck harness модель пишет и выполняет Python в живом REPL, превращая состояние игры в переменные, с которыми можно рассуждать напрямую, а не разглядывая отрендеренную картинку. Чтобы долгая сессия оставалась работоспособной, харнесс вытесняет самые старые сообщения из контекста, когда диалог становится слишком длинным — в Tufa Labs это описывают как игру без конца, а не игру, в которой заканчивается место для рассуждений. Там, где нужно восприятие, оно сочетает отрендеренный кадр, ASCII-сетку и инструмент для приближения к конкретным участкам.
Два решения, занявшие второе и третье места, пошли более привычным путём: модель с распознаванием изображений читает отрендеренную доску и на каждом шаге возвращает одно действие в формате JSON. Версия Reki обновляла память-рефлексию примерно каждые десять шагов и использовала жёстко заданную эвристику для исследовательских кликов, а также механизм, который команда назвала «мёртвой сигнатурой» — он останавливал клики по типам объектов, уже показавшим бесполезность. forge от Murad использовала похожий конвейер «изображение → JSON», обёрнутый в настраиваемый фреймворк с арбитром, выбирающим между вариантами действий, — примечательно, что именно тот прогон, который в итоге занял третье место, шёл с отключённой дополнительной механикой.
По баллам две доступные цифры расходятся, и это существенно. Сама Tufa Labs называет 1,21 процента для победившей конфигурации; AlphaSignal приводит 1,03 на лидерборде Kaggle — а именно по нему соревнование и ранжирует участников. В абсолютных величинах это мало в обоих случаях, и в обоих случаях это выше универсальных флагманских моделей: по данным AlphaSignal, они набирают на том же тесте менее 1 процента, а GPT-5.4 и Gemini — обе ниже 0,5 процента, при том что на более старом статичном ARC-AGI-1 эти же модели показывают результат, близкий к идеальному. Разрыв между открытой моделью на 27 миллиардов параметров с лёгким харнессом и системами несопоставимо большего масштаба и бюджета по этому измерению практически стёрт. Но и перевес невелик: 1,03 против 0,5 — это доли процентного пункта.
Стоимость — вторая ось, которую и должен был высветить этот рубеж. По словам Tufa Labs, их харнесс обходился на порядок дешевле за игру, чем сравниваемая система, которую они называют Executable World Models, при сопоставимом охвате игр — свидетельство того, что в этой задаче конструкция харнесса и эффективное исследование значат больше, чем число параметров или расходы на инференс.
Второй и последний контрольный рубеж по призу ARC-AGI-3 закрывается 30 сентября 2026 года с той же структурой призов — 25 000/10 000/2 500 долларов. Выйдет ли на этот раз в игру напрямую флагманская лаборатория, или поле снова достанется небольшой открытой модели в аккуратном харнессе, решит именно эта дата.