Видео опубликовано 7 сентября 2026

Почему среда агента важнее модели

Память, инструменты и организация работы определяют, как далеко агент продвинется с теми же весами модели.

Why The Harness Matters More Than The Model | YC Paper Club

Постер выпуска YC Paper Club о среде выполнения агентовСмотреть на YouTube ↗
Y CombinatorYouTube1 ч 00 мин 11 с70 160 просмотров при скачиванииРусский конспект · оригинал на английском
01 / ГЛАВНОЕ

Агенту нужна среда, в которой он может продолжать работу

Harness — программная среда вокруг языковой модели: она собирает контекст, запускает инструменты, сохраняет состояние и управляет следующими шагами. В этом выпуске исследователи и команда YC показывают, как изменение этой среды влияет на результат.

Prime Agent: состояние за пределами контекста

Агент хранит переменные и сессии субагентов вне окна модели, обращается к ним через код и может обновлять собственные инструкции и навыки.

18:37 ↗

OpenJarvis: облако готовит локальную систему

Сильная модель помогает настроить локальный стек. После этого задачи выполняются на устройстве, без постоянного обращения к облачной модели.

42:47 ↗

QM: «мозг» живёт отдельно от песочницы

YC централизует историю и память рабочих агентов, а вычислительную среду и модель позволяет выбирать под задачу.

51:04 ↗

Оценивать нужно качество вместе с расходами

Число решённых задач зависит от изоляции, бюджета и организации попыток. Одного итогового процента для сравнения агентов недостаточно.

29:40 ↗

Цифры ниже передают результаты и заявления докладчиков. Конспект основан на видео, автоматических субтитрах и просмотренных слайдах; независимая проверка экспериментов не проводилась.

02 / ОТ ЦИКЛА К САМОИЗМЕНЕНИЮ

Что именно добавляет harness

Цикл работы агентаЗадача и состояниеистория, память, инструкцииСборка контекставыбрать нужные сведенияВызов моделирешить, что делать дальшеИнструменты и проверкасохранить результат, повторить

Во вводной части путь начинается с простого цикла генерации токенов. Затем появляются примеры в промпте, рассуждения по шагам, вызовы инструментов, память и навыки. Вместе эти механизмы задают доступные агенту действия и сведения. 07:13 ↗

В статическом варианте разработчик заранее задаёт системный промпт, разрешённые инструменты, роли субагентов и лимиты. Даже при сильной модели фиксированная организация работы может ограничить результат.

Следующий шаг обсуждения — разрешить агенту менять часть собственной среды: сохранять полезные приёмы, редактировать инструкции, запускать новые проверки. Тогда результат одной попытки влияет на следующие.

Статическая среда агента: восстановление сессии, сборка контекста, вызов модели и выполнение инструментов. Справа заданы ограничения и доступные навыки. 13:50 ↗

Изменения отбирает проверка

Во вводном разборе DSPy перебирает варианты системного промпта и оценивает их на небольшом обучающем наборе. В примере с Darwin Machines в архив попадают пары «harness + системный промпт»: варианты проходят функцию оценки, а агент получает возможность менять собственную среду. Сохранение нового текста само по себе ещё не доказывает улучшение. 13:56 ↗

Автоисследователь: от идеи к проверке

Ведущий рассказывает, как начал с форка автоисследователя Карпати и интерфейса для наблюдения за работой. В получившейся системе пользователь задаёт цель, начальные идеи и метрику проверки. Один агент ищет похожие работы, другие проводят исследование и обсуждают результат; отдельный агент фиксирует идею, запускает проверки вклада отдельных изменений и пишет статью. Положительная оценка полученных статей в этом рассказе принадлежит самому автору. 04:27 ↗

«Harness — это слой между LLM и миром».

Seth Karten · перевод короткой цитаты 19:43 ↗
03 / PRIME AGENT

Окно контекста — только один уровень памяти

Seth Karten описывает RLM, рекурсивную языковую модель, как агента, который программно вызывает другие агентские сессии. Корневой агент работает с инструментами, памятью и субагентами через IPython: интерактивную среду выполнения Python. Постоянный фоновый процесс поддерживает работу независимо от открытого ноутбука пользователя. 18:37 ↗

Схема памяти на слайде разделяет четыре уровня. Нумерация ниже следует слайду.

L0 / ВЕСА

Знания модели

Параметры, полученные при обучении. На слайде обновление этого уровня связано с дообучением модели.

L1 / КОНТЕКСТ

Рабочее окно одного вызова

Модель видит только попавшие сюда токены. История требует отбора и сжатия, когда перестаёт помещаться.

L2 / REPL И СУБАГЕНТЫ

Живое состояние вычислений

REPL, интерактивная среда выполнения кода, хранит переменные и состояние между вызовами. Код и дочерние сессии остаются доступными вне контекста модели. Нужные данные можно извлекать программно.

L3 / ДИСК

История и накопленный опыт

Файлы, артефакты, память, навыки, промпты и описания субагентов переживают отдельный вызов модели.

Четыре уровня состояния Prime Agent: веса модели, активный контекст, REPL и субагенты, данные на диске. Для каждого уровня показан свой способ обновления. 21:55 ↗

У каждого уровня своя уборка. Сжатие освобождает контекст; удаление ненужных переменных и сессий очищает живое состояние; пересмотр сохранённого опыта обновляет или удаляет устаревшие навыки и инструкции. Просто складывать всё в память недостаточно.

Субагент остаётся доступен после первого ответа

Вызов rlm() возвращает ссылку на постоянную сессию. Её можно возобновить и уточнить задачу. Родитель, дети и соседние агенты обмениваются сообщениями напрямую; фоновые очереди поддерживают асинхронную работу.

Вызов rlm() создаёт сессию субагента и возвращает ссылку на неё. Сессия может работать, ждать, становиться неактивной и возобновляться. 26:45 ↗
Прямые сообщения связывают корневого агента, соседних и вложенных субагентов. Пунктиром показан обмен через фоновые очереди. 28:16 ↗
04 / КАК ЧИТАТЬ РЕЗУЛЬТАТЫ

95,5% имеет смысл вместе с условиями запуска

30% → 95%

Пример из вступления

Ведущий сравнивает Claude Opus без улучшенной среды и с ней на закрытой проверочной выборке ARC-AGI.

Это заявленное сравнение из выступления; одинаковый бюджет в этом фрагменте не установлен.03:10 ↗
95,5%

Результат Prime Agent после исправления изоляции

Seth сообщает этот результат с Opus. Предыдущие 99,9% он признаёт некорректными: агент смог обойти ограничения эксперимента.

Проверка среды здесь меняет интерпретацию результата.30:04 ↗

Докладчик предлагает смотреть на кривую качества по мере расходования ресурсов. Одна система быстро перестаёт улучшаться; другая продолжает находить решения при увеличении бюджета. Сравнение при фиксированных расходах и поиск предела качества отвечают на разные вопросы.

Схематический график: качество решения растёт с расходами на выполнение, затем выходит на плато. Это иллюстрация принципа, а не измеренные результаты. 29:40 ↗

Эмуляторы и GPU-ядра проверяют разные свойства

Emulator Bench докладчик представляет как готовящийся тест на воспроизведение целых эмуляторов, например Game Boy Color. Доступ к программной среде позволяет агенту проводить собственные эксперименты до окончательной сдачи решения проверяющей системе. 33:09 ↗

На задачах написания GPU-ядер Seth описывает результат примерно на уровне сравниваемых подходов: на одной модели лучше, на другой хуже. Убедительного общего превосходства в этом фрагменте нет. В недельных автоисследованиях он также отмечает большой разброс результатов и не берётся отделить вклад harness от вклада модели.

Практический вывод из этого разбора: фиксируйте модель, ограничения доступа, проверочную выборку и расходы. Сохраняйте следы выполнения, чтобы отличить решение задачи от обхода проверки.

05 / OPENJARVIS

Облачная модель помогает подготовить локальный стек

Jon Saad-Falcon рассматривает персонального агента как систему на устройстве пользователя. На слайде пять сменяемых частей: модель, движок инференса, агентная логика, инструменты с памятью и обучение. Пользовательские интерфейсы окружают этот стек, а оборудование находится под движком. 39:21 ↗

Такое разбиение позволяет улучшать всю конфигурацию: выбирать модель и способ её запуска, настраивать инструменты, менять логику агента. Модель в облаке помогает диагностировать ошибки и искать улучшения локальной системы.

OpenJarvis: агент объединяет модель, движок выполнения, инструменты и память, обучение. Вложенность блоков показывает связи между частями локальной системы. 40:11 ↗

Во время настройки

Сильная облачная модель анализирует ошибки и помогает оптимизировать локальный стек. На этом этапе возникают затраты на облачные вызовы.

42:47 ↗

Во время работы

Локальная система использует полученные улучшения на устройстве. Облачная модель не должна участвовать в каждом пользовательском запросе.

43:53 ↗
Spec Search: сравнение исходных локальных моделей с вариантами, улучшенными с помощью облачных моделей. Отдельные панели посвящены PinchBench, LiveCodeBench и LiveResearchBench. 44:33 ↗

На слайде лучший вариант Qwen3.5-9B после оптимизации поиском достигает 100% на PinchBench, 83% на LiveCodeBench и 91% на LiveResearchBench. Это результаты отдельных тестов; они не означают, что локальная модель сравнялась с облачной на любых задачах.

«В 800 раз дешевле» — заявление докладчика о стоимости локального выполнения. В соответствующем фрагменте речи нет точного базового варианта, оборудования и нагрузки для этого коэффициента. Переносить его на свой проект без измерений нельзя. 43:53 ↗

06 / QM ВНУТРИ YC

Агент выбирает среду, а история остаётся с ним

Josh France и Regan Bell рассказывают о персональных помощниках сотрудников YC в Slack и веб-интерфейсе. Управление парком из более чем 50 виртуальных машин с агентами потребовало ручной настройки и ремонта через SSH. Это подтолкнуло команду отделить агента от машины, на которой выполняются его инструменты. 49:24 ↗

Разделение состояния и вычислений в QMСостояние агентаPostgres: сессии и памятьНезависимое ядроцикл агента и управлениеСреда под задачупесочница, файлы, инструменты

Песочница становится сменяемым ресурсом

История сессий и память централизованы в Postgres. Ядро агента обращается к отдельной песочнице с файлами, инструментами и авторизациями. Замена этой среды больше не должна уничтожать идентичность и историю помощника.

Агент может выбрать вычислительные ресурсы, провайдера и модель под текущую задачу. Команда оставляет ядро небольшим, чтобы остальные возможности агент мог создавать и менять сам. 54:43 ↗

QM: цикл агента вынесен в отдельное ядро. Слева находятся сессии, память и очередь в Postgres, справа — файлы, инструменты и авторизации в песочнице. 52:17 ↗

Бюджет задаётся цели

Инструмент grind не позволяет агенту отказаться от нерешённой задачи до заданного порога времени или расхода токенов. В описании команды это минимальное усилие перед отказом; верхнюю границу расходов такая формулировка не задаёт.

57:16 ↗

Доступ требует социального контекста

В конце доклада команда отмечает: агенты могут неверно понять, кому можно передать сведения. Общая память требует точных прав доступа; одного доступа к источнику недостаточно для безопасного обмена данными.

58:50 ↗

«Мы задаём бюджет для целей».

Команда QM · перевод короткой цитаты 57:50 ↗
07 / НАВИГАЦИЯ ПО ВИДЕО

15 точек для повторного просмотра

Время открывает нужный момент на YouTube. Нажмите на миниатюру, чтобы рассмотреть слайд и перейти к нему в видео.

00:00 ↗

Почему среда агента заслуживает исследования

Главный вопрос выпуска: что меняется, когда модель получает другую память, инструменты и организацию работы.

04:27 ↗

Автоисследователь из рабочего агента

Цель, исходные идеи и проверяемая метрика превращают агента в участника итеративного исследования.

07:13 ↗

История harness

От генерации токенов к рассуждениям, инструментам, памяти и навыкам.

13:50 ↗

Устройство статического harness

На слайде видны цикл выполнения, сборка контекста и спецификация агента.

18:37 ↗

Prime Agent и рекурсивные сессии

Seth Karten объясняет, как агент обращается к вычислениям и состоянию за пределами окна модели.

21:55 ↗

Память L0–L3

Веса, контекст, живые вычисления и данные на диске обновляются разными механизмами.

26:45 ↗

Жизненный цикл субагента

Сессия сохраняется между обращениями и может снова перейти к работе.

28:16 ↗

Сообщения между агентами

Связи между родителем, детьми и соседями дополняются фоновыми очередями.

29:40 ↗

Качество зависит от бюджета

Схематическая кривая показывает рост результата и выход на плато.

30:04 ↗

ARC-AGI и проверка изоляции

Seth разбирает результат Prime Agent и объясняет, почему ранний запуск был некорректным.

40:11 ↗

Пять частей OpenJarvis

Архитектура локального агента объединяет модель, движок, логику, инструменты с памятью и обучение.

42:47 ↗

Облако оптимизирует локальную систему

Сильная модель участвует в подготовке стека; пользовательские задачи затем выполняются локально.

44:33 ↗

Результаты Spec Search

Графики показывают изменения на трёх тестах после оптимизации с помощью облачных моделей.

52:17 ↗

QM отделяет ядро от песочницы

История и память в Postgres связаны с независимым циклом агента и сменяемой средой выполнения.

58:50 ↗

Социальный контекст остаётся проблемой

Финальное ограничение: агенту трудно понять, какие сведения можно раскрывать конкретным людям.

08 / ПРАКТИКА

Что проверить в своём агенте

Чек-лист составлен по мотивам выступлений. Это шаги для собственного эксперимента, а не обещание повторить цифры со слайдов.

Смотреть этот момент ↗