Мой автономный агент под названием Ouroboros сумел обойти модели Codex и Claude Code в нескольких бенчмарках - Terminal-Bench, OSWorld и CL-Bench. Причём одна из самых неожиданных деталей: агент написал свою собственную кодовую базу в ходе экспериментов. Ниже - подробный рассказ о том, как это произошло, какие результаты были получены и что это значит для будущего автономных агентов.
Как всё началось- идея и настройка эксперимента
Проект возник из желания проверить, смогут ли современные агенты не только выполнять поставленные задачи, но и самостоятельно улучшать собственный код.
Я поставил перед Ouroboros задачу работать как автономный агент: получать инструкции, планировать действия, запускать процессы и адаптироваться к возникающим проблемам. В качестве точки сравнения были взяты Codex и Claude Code - хорошо известные модели, показавшие себя в различных сценариях программирования и автоматизации.
Для честного тестирования я использовал три популярные тестовые площадки: Terminal-Bench, OSWorld и CL-Bench. Каждая из них проверяет разные аспекты автономности: от умения работать с терминалом и запускать команды до понимания операционных систем и управления сложными сценариями.
Важно было сохранить сопоставимые условия для всех участников, чтобы результаты не были искажены завышенными ресурсами или ручной донастройкой. Я подготовил набор задач и метрик, которые учитывать скорость, точность и устойчивость к ошибкам.
Ouroboros получил доступ к инструментам для исполнения команд и ограниченному окружению, в котором он мог тестировать и изменять свой собственный код.
Это был ключевой момент: агенту разрешили модифицировать исходники при условии, что он сопровождает изменения тестами и объяснениями.
Результаты на бенчмарках? Где Ouroboros превзошёл конкурентов
На Terminal-Bench Ouroboros продемонстрировал высокую точность при выполнении команд и взаимодействии с оболочкой. Он быстрее находил правильные команды и корректно обрабатывал ошибки, возикавшие в процессе.
Это отразило не просто знание синтаксиса, а умение планировать последовательность действий и корректировать их в случае нештатной ситуации.
OSWorld проверяет более сложные навыки - работу с файлами, настройку окружения и сценарии, приближённые к реальному администрированию. Там Ouroboros также показал себя сильнее: он не только успешно завершал сценарии, но и предлагал оптимизации, сокращающие количество шагов и уменьшающие риск ошибок при повторении действий.
Такой подход выгодно отличал его от Codex и Claude Code, которые чаще выполняли стандартные последовательности без глубокой адаптации. На CL-Bench агент проявил гибкость в понимании задач и коммуникативных нюансов.
Там важна не только техническая корректность, но и способность интерпретировать многозначные инструкции и предлагать адекватные уточнения. Ouroboros оказался более устойчив к неоднозначностям и лучше справлялся с ситуациями, где требовалось планирование нескольких шагов вперед.
Основные преимущества в работе
Ouroboros выделялся способностью к самоисправлению: при выявлении багов он формировал тесты, локализовал проблему и вносил правки. Это открывало цикл "обнаружение - фиксация - проверка", что повышало стабильность его решений со временем. Такой итеративный подход оказался особенно полезен в долгоиграющих задачах, где первоначальная версия кода могла давать сбои.
Другой важный момент - умение минимизировать побочные эффекты.
При модификации алгоритмов агент стремился сохранить обратную совместимость с существующими компонентами, что снижало риск регресса. Это было заметно в тестах, где развертывание нового поведения не ломало ранее успешные сценарии.
Как агент написал себя. Автогенерация и безопасность
Самая обсуждаемая часть эксперимента - то, что Ouroboros переписывал собственные модули. Это происходило на основе набора правил и тестов: агент мог предложить изменения, затем запускал тесты и, при успешном прохождении, применять обновления. Такой процесс отличается от простого автосгенерирования кода; здесь важную роль играла валидация и ограничение прав доступа, чтобы изменения не приводили к неконтролируемым последствиям.
Безопасность была приоритетом.
Я реализовал уровни контроля: изменения, затрагивающие критичные компоненты, требовали дополнительных проверок и логирования.
Все действия агента фиксировались позволило вернуть прежнюю версию при возникновении признаков деградации. К тому же, система запрещала внешние сетевые вызовы без явного разрешения, что уменьшало риск непреднамерённых утечек или использования внешних ресурсов.
В результате Ouroboros смог улучшить свою производительность и надёжность, не нарушая базовых требований безопасности.
Это демонстрирует, что при грамотной архитектуре автономные агенты могут безопасно участвовать в развитии собственных алгоритмов.
Ограничения и наблюдения
Несмотря на впечатляющие достижения, у подхода есть свои ограничения.
Успехи агента зависят от качества тестов и сценариев: если тесты неполны, агент может внести изменения, которые пройдут проверки, но поведут себя некорректно в реальных условиях. Автогенерация кода требует дополнительного времени и вычислительных ресурсов, что не всегда оправдано при простых задачах.
Ещё один нюанс - интерпретация результатов на бенчмарках. Хотя Ouroboros показал лучшие средние показатели, это не означает, что он универсально превосходит конкурентов во всех возможных ситуациях. Разные модели обладают различными сильными сторонами, и в некоторых нишах Codex или Claude Code могут сохранять преимущество.
Что это значит для будущего автономных агентов
Эксперимент с Ouroboros даёт обоснование идеи: автономные агенты способны не только решать поставленные задачи, но и эволюционировать, улучшая собственную реализацию. Порядок действий - планирование, тестирование, внесение изменений и повторная проверка - может стать стандартной практикой для сложных систем, которым нужно сохранять надёжность при постоянной эволюции.
Такой подход открывает перспективы для автоматизированного сопровождения инфраструктуры, разработки и даже обучения моделей. В идеале агенты смогут брать на себя рутинную часть инженерной работы, оставляя людям творческие и стратегические решения.
Но для этого необходимо развивать инструменты верификации, аудит действий и механизмы безопасного отката.
Практические выводы и рекомендации
Если вы планируете внедрять автономных агентов в свои процессы, стоит начать с чёткой стратегии тестирования: разработать полный набор сценариев, покрывающих критичные и пограничные случаи.
Обязательно введите уровни доступа и журналирование изменений, чтобы иметь возможность отслеживать и откатывать правки. Также рекомендуем использовать итеративный подход: не допускать радикальных самопереписываний без предварительной валидации и симуляции.
Важна прозрачность - агент должен объяснять свои правки и мотивы, чтобы команда могла быстро понять причину изменений. В заключение, опыт с Ouroboros показывает: при грамотной организации автономные агенты способны не только успешно конкурировать с современными моделями, но и эволюционировать свою кодовую базу безопасным способом.
Это шаг к более самостоятельным и надёжным системам, но требующий тщательной архитектуры контроля и тестирования.