Prime Agent: состояние за пределами контекста
Агент хранит переменные и сессии субагентов вне окна модели, обращается к ним через код и может обновлять собственные инструкции и навыки.
18:37 ↗Память, инструменты и организация работы определяют, как далеко агент продвинется с теми же весами модели.
Why The Harness Matters More Than The Model | YC Paper Club
Harness — программная среда вокруг языковой модели: она собирает контекст, запускает инструменты, сохраняет состояние и управляет следующими шагами. В этом выпуске исследователи и команда YC показывают, как изменение этой среды влияет на результат.
Агент хранит переменные и сессии субагентов вне окна модели, обращается к ним через код и может обновлять собственные инструкции и навыки.
18:37 ↗Сильная модель помогает настроить локальный стек. После этого задачи выполняются на устройстве, без постоянного обращения к облачной модели.
42:47 ↗YC централизует историю и память рабочих агентов, а вычислительную среду и модель позволяет выбирать под задачу.
51:04 ↗Число решённых задач зависит от изоляции, бюджета и организации попыток. Одного итогового процента для сравнения агентов недостаточно.
29:40 ↗Цифры ниже передают результаты и заявления докладчиков. Конспект основан на видео, автоматических субтитрах и просмотренных слайдах; независимая проверка экспериментов не проводилась.
Во вводной части путь начинается с простого цикла генерации токенов. Затем появляются примеры в промпте, рассуждения по шагам, вызовы инструментов, память и навыки. Вместе эти механизмы задают доступные агенту действия и сведения. 07:13 ↗
В статическом варианте разработчик заранее задаёт системный промпт, разрешённые инструменты, роли субагентов и лимиты. Даже при сильной модели фиксированная организация работы может ограничить результат.
Следующий шаг обсуждения — разрешить агенту менять часть собственной среды: сохранять полезные приёмы, редактировать инструкции, запускать новые проверки. Тогда результат одной попытки влияет на следующие.
Во вводном разборе DSPy перебирает варианты системного промпта и оценивает их на небольшом обучающем наборе. В примере с Darwin Machines в архив попадают пары «harness + системный промпт»: варианты проходят функцию оценки, а агент получает возможность менять собственную среду. Сохранение нового текста само по себе ещё не доказывает улучшение. 13:56 ↗
Ведущий рассказывает, как начал с форка автоисследователя Карпати и интерфейса для наблюдения за работой. В получившейся системе пользователь задаёт цель, начальные идеи и метрику проверки. Один агент ищет похожие работы, другие проводят исследование и обсуждают результат; отдельный агент фиксирует идею, запускает проверки вклада отдельных изменений и пишет статью. Положительная оценка полученных статей в этом рассказе принадлежит самому автору. 04:27 ↗
«Harness — это слой между LLM и миром».
Seth Karten · перевод короткой цитаты 19:43 ↗
Seth Karten описывает RLM, рекурсивную языковую модель, как агента, который программно вызывает другие агентские сессии. Корневой агент работает с инструментами, памятью и субагентами через IPython: интерактивную среду выполнения Python. Постоянный фоновый процесс поддерживает работу независимо от открытого ноутбука пользователя. 18:37 ↗
Схема памяти на слайде разделяет четыре уровня. Нумерация ниже следует слайду.
Параметры, полученные при обучении. На слайде обновление этого уровня связано с дообучением модели.
Модель видит только попавшие сюда токены. История требует отбора и сжатия, когда перестаёт помещаться.
REPL, интерактивная среда выполнения кода, хранит переменные и состояние между вызовами. Код и дочерние сессии остаются доступными вне контекста модели. Нужные данные можно извлекать программно.
Файлы, артефакты, память, навыки, промпты и описания субагентов переживают отдельный вызов модели.
У каждого уровня своя уборка. Сжатие освобождает контекст; удаление ненужных переменных и сессий очищает живое состояние; пересмотр сохранённого опыта обновляет или удаляет устаревшие навыки и инструкции. Просто складывать всё в память недостаточно.
Вызов rlm() возвращает ссылку на постоянную сессию. Её можно возобновить и уточнить задачу. Родитель, дети и соседние агенты обмениваются сообщениями напрямую; фоновые очереди поддерживают асинхронную работу.
Ведущий сравнивает Claude Opus без улучшенной среды и с ней на закрытой проверочной выборке ARC-AGI.
Это заявленное сравнение из выступления; одинаковый бюджет в этом фрагменте не установлен.03:10 ↗Seth сообщает этот результат с Opus. Предыдущие 99,9% он признаёт некорректными: агент смог обойти ограничения эксперимента.
Проверка среды здесь меняет интерпретацию результата.30:04 ↗Докладчик предлагает смотреть на кривую качества по мере расходования ресурсов. Одна система быстро перестаёт улучшаться; другая продолжает находить решения при увеличении бюджета. Сравнение при фиксированных расходах и поиск предела качества отвечают на разные вопросы.
Emulator Bench докладчик представляет как готовящийся тест на воспроизведение целых эмуляторов, например Game Boy Color. Доступ к программной среде позволяет агенту проводить собственные эксперименты до окончательной сдачи решения проверяющей системе. 33:09 ↗
На задачах написания GPU-ядер Seth описывает результат примерно на уровне сравниваемых подходов: на одной модели лучше, на другой хуже. Убедительного общего превосходства в этом фрагменте нет. В недельных автоисследованиях он также отмечает большой разброс результатов и не берётся отделить вклад harness от вклада модели.
Практический вывод из этого разбора: фиксируйте модель, ограничения доступа, проверочную выборку и расходы. Сохраняйте следы выполнения, чтобы отличить решение задачи от обхода проверки.
Jon Saad-Falcon рассматривает персонального агента как систему на устройстве пользователя. На слайде пять сменяемых частей: модель, движок инференса, агентная логика, инструменты с памятью и обучение. Пользовательские интерфейсы окружают этот стек, а оборудование находится под движком. 39:21 ↗
Такое разбиение позволяет улучшать всю конфигурацию: выбирать модель и способ её запуска, настраивать инструменты, менять логику агента. Модель в облаке помогает диагностировать ошибки и искать улучшения локальной системы.
Сильная облачная модель анализирует ошибки и помогает оптимизировать локальный стек. На этом этапе возникают затраты на облачные вызовы.
42:47 ↗Локальная система использует полученные улучшения на устройстве. Облачная модель не должна участвовать в каждом пользовательском запросе.
43:53 ↗На слайде лучший вариант Qwen3.5-9B после оптимизации поиском достигает 100% на PinchBench, 83% на LiveCodeBench и 91% на LiveResearchBench. Это результаты отдельных тестов; они не означают, что локальная модель сравнялась с облачной на любых задачах.
«В 800 раз дешевле» — заявление докладчика о стоимости локального выполнения. В соответствующем фрагменте речи нет точного базового варианта, оборудования и нагрузки для этого коэффициента. Переносить его на свой проект без измерений нельзя. 43:53 ↗
Josh France и Regan Bell рассказывают о персональных помощниках сотрудников YC в Slack и веб-интерфейсе. Управление парком из более чем 50 виртуальных машин с агентами потребовало ручной настройки и ремонта через SSH. Это подтолкнуло команду отделить агента от машины, на которой выполняются его инструменты. 49:24 ↗
История сессий и память централизованы в Postgres. Ядро агента обращается к отдельной песочнице с файлами, инструментами и авторизациями. Замена этой среды больше не должна уничтожать идентичность и историю помощника.
Агент может выбрать вычислительные ресурсы, провайдера и модель под текущую задачу. Команда оставляет ядро небольшим, чтобы остальные возможности агент мог создавать и менять сам. 54:43 ↗
Инструмент grind не позволяет агенту отказаться от нерешённой задачи до заданного порога времени или расхода токенов. В описании команды это минимальное усилие перед отказом; верхнюю границу расходов такая формулировка не задаёт.
В конце доклада команда отмечает: агенты могут неверно понять, кому можно передать сведения. Общая память требует точных прав доступа; одного доступа к источнику недостаточно для безопасного обмена данными.
58:50 ↗«Мы задаём бюджет для целей».
Команда QM · перевод короткой цитаты 57:50 ↗
Время открывает нужный момент на YouTube. Нажмите на миниатюру, чтобы рассмотреть слайд и перейти к нему в видео.
Главный вопрос выпуска: что меняется, когда модель получает другую память, инструменты и организацию работы.
Цель, исходные идеи и проверяемая метрика превращают агента в участника итеративного исследования.
От генерации токенов к рассуждениям, инструментам, памяти и навыкам.
На слайде видны цикл выполнения, сборка контекста и спецификация агента.
Seth Karten объясняет, как агент обращается к вычислениям и состоянию за пределами окна модели.
Веса, контекст, живые вычисления и данные на диске обновляются разными механизмами.
Сессия сохраняется между обращениями и может снова перейти к работе.
Связи между родителем, детьми и соседями дополняются фоновыми очередями.
Схематическая кривая показывает рост результата и выход на плато.
Seth разбирает результат Prime Agent и объясняет, почему ранний запуск был некорректным.
Архитектура локального агента объединяет модель, движок, логику, инструменты с памятью и обучение.
Сильная модель участвует в подготовке стека; пользовательские задачи затем выполняются локально.
Графики показывают изменения на трёх тестах после оптимизации с помощью облачных моделей.
История и память в Postgres связаны с независимым циклом агента и сменяемой средой выполнения.
Финальное ограничение: агенту трудно понять, какие сведения можно раскрывать конкретным людям.
Чек-лист составлен по мотивам выступлений. Это шаги для собственного эксперимента, а не обещание повторить цифры со слайдов.