#ai #agents #video #webinar # Выводы по видео **Источник:** https://www.youtube.com/watch?v=a-NIeMB-Hj8 **Название:** Скиллы на базе git — новая память AI-агентов. Мой опыт **Автор:** Константин (Сбер, команда разработки ГигаЧата, R&D по агентам) **Длительность:** 53:09 --- ## Главный тезис **Скиллы, объединённые с данными пользователя и алгоритмами автоулучшения — это новая память AI-агентов, к которой все агентные системы в итоге придут.** Это не просто «набор навыков», это принципиально новая архитектура памяти, в которой: - инструменты (как их вызывать) - данные (то, над чем работаем) - история использования (что уже сделано) лежат вместе в одном git-репозитории, и харнесс сам решает, что подгружать в контекст в конкретный момент. Автор ведёт слушателя от исторического рекапа к практическому опыту и заканчивает моделью «трёхуровневого агентного цикла», который, по его прогнозу, будет доминировать в 2027. --- ## Часть 1. Рекап эволюции агентов (как мы пришли к харнессам) ### Таймлайн | Период | Что появилось | Что это дало | |---|---|---| | Начало 2023 | LLM / ChatGPT (не чатовая) — задал вопрос, получил ответ | Нет памяти, нет инструментов, одноходовой обмен | | Лето 2023 | Концепция **ReAct-агентов** — LLM может либо ответить текстом, либо вызвать функцию | Впервые появился «агентный цикл»: вызов инструментов → рефлексия → изменение поведения. Мир научился давать LLM обратную связь через tools | | 2023–2024 | Цепочки вызовов, роли, первые агентные SDK, векторные БД, **RAG**, JSON-структурированные ответы | Агент становится сложнее, начал использовать внешние знания | | 2024 | Цепочки → **графы**. LangGraph. Мультиагентные подходы (агент-планировщик, агент-критик, третий агент отвечает). Фреймворки: AutoGen, CrewAI. **Скаффолдинг** — сложная конструкция вокруг LLM | Пик технической сложности агентов | | Конец 2025 | Внезапное **упрощение**. Оказалось, что достаточно простого агента с ~10 базовыми функциями работы с файлами, чтобы решать сложные задачи. Начало эпохи **универсальных агентов = харнессов** | Резкое снижение сложности при росте возможностей | | 2026 (сейчас) | Универсальные агенты (харнессы) вкладываются во внешние циклы (**Ralph loop**), запускаются на дни/недели. Появляется **AI factory** (полностью автономная работа без human-in-the-loop) | Human-in-the-middle → man-on-the-middle → полное отсутствие человека | | 2027 (прогноз) | Доминирование скиллов + агентных циклов | — | ### Эволюция ролей человека - **Prompt-инженер** (текстовое описание задачи) → **Context-инженер** (сложный prompt с памятью, RAG, структурами) → **Harness-строитель** (архитектура харнесса, политики, песочница) → сейчас поднимается **Loop-инженер** (построение циклов вокруг агента: CI/CD, back-pressure, метациклы) ### Ключевая мысль этой части «За полгода всё меняется». Ничего фундаментального в этой сфере пока нет. Только что утвердили MCP — уже все хотят A2A. Корпорации от этого страдают. --- ## Часть 2. Что такое харнесс ### Определение и метафора **Харнесс** (в переводе — упряжка) = агент + инструменты. LLM — источник силы. Набор инструментов — упряжка. Поле задач — данные. LLM, запряжённая в инструменты, «тянет их по пространству данных», превращая необработанные задачи в решённые. Важно: **задачи разные, а способ их обработки одинаковый** — одна и та же упряжка (харнесс) решает большое количество разнородных задач. ### Стандартный набор инструментов харнесса (~30–40 max) | Категория | Инструменты | |---|---| | Файлы | Read, Edit, Write | | Shell | Bash | | Поиск | Grep, Glob, WebSearch | | Планирование | TodoWrite/TodoRead | | Расширение | Спавн субагентов | **Предел:** >30–40 встроенных тулов не встречается ни в одном популярном харнессе. Больше 100 — LLM (даже Fable 5) начинает путаться, и контекст уходит с огромной скоростью, потому что каждый тул подкладывается в вызов. ### Из чего состоит хороший харнесс 1. **Короткий system prompt** («используй инструменты, чтобы решить задачу»). Чем короче — тем лучше. 2. **Набор стандартных тулов** (см. выше). 3. **Runtime loop** — тот же ReAct-цикл: вызывай тулы, пока не решишь. 4. **Управление контекстом** — своевременная суммаризация, запуск субагентов без передачи полного контекста. 5. **Стандартизованные ключевые файлы** — AGENTS.md, CLAUDE.md, GEMINI.md для описания проекта; директории `skills/` со `SKILL.md`; подключение MCP-серверов. 6. **Устойчивость к нештатным ситуациям** — обрывам соединения, ошибкам ОС, отключению VPN. 7. **Интерфейс** — консольный CLI, чат, мессенджер. ### Два режима работы харнесса (де-факто стандарт) | Режим | Описание | Термин | |---|---|---| | Интерактивный | Постоянные уточнения у человека («можно я прочту этот файл?») | Human-in-the-middle → man-on-the-middle (человек уже не контролирует, а лишь присматривает) | | Автономный (fire-and-forget) | Запуск через CLI с задачей аргументом; агент решает и возвращает результат | Позволяет встраивать харнессы в CI/CD и строить цепочки последовательных вызовов | ### Популярные харнессы - **Claude Code** - **Codex CLI** - **Cursor** (в каком-то смысле) - **OpenClaude** (форк Claude Code) - **Hermes** — построен полностью вокруг скиллов - И почти все агенты «последнего поколения» ### Личный опыт: харнессы — must-have (три хакатона) | Хакатон | Результат | Технология | |---|---|---| | Interpress-Ex Challenge | 7 место | Свой харнесс, запущенный в бесконечном цикле на выходные. **Ни одну задачу глазами не читал** — просто оставил агента работать | | Snowbase Camp | 3 место общее / 1 по техническим метрикам | Утечённый Claude Code в качестве бэкенда + красивый фронт. Идеально, когда задача плохо понятна заранее | | BitGen | ~топ-20 | Обнаружил инсайт: **19 из 20 команд-топов делали свои решения на харнессах**. Все, кто участвует в интересных хакатонах, уже перешли на них | --- ## Часть 3. Эволюция инструментов агентов ### Три поколения ``` Tools (2022–2024) → MCP (кон.2024–2025) → Skills (2025→) ``` ### Tools (2022–2024) - Функция, помеченная тегом, подкладывается в вызов модели. - Каждый тул попадает в контекст. - Библиотеки от LangChain, LlamaIndex. - **Проблема:** приходилось каждый раз писать или адаптировать самому. ### MCP-серверы (конец 2024 → 2025, Anthropic) - Локально развёрнутый сервер, подключаемый к агенту стандартным протоколом. - К агенту сразу добавляется несколько готовых тулов. - Появились маркетплейсы MCP. - **Проблемы:** - Многие MCP содержат десятки тулов → быстро съедается контекст (>100 функций = хаос). - Безопасность: если сервер подгружается по сети, поведение агента может неожиданно измениться. - Автор **не хейтит MCP** — проблемы во многом уже решены, MCP имеет право на жизнь. ### Skills (2025 →) — главная тема доклада **Скилл** = директория + джентльменское соглашение. Состав: - `SKILL.md` — как работает этот скилл - Инструменты (bash-скрипты, Python-код) в той же директории - (новое предложение автора) — **данные** прямо в этой же директории **Ключевое преимущество: двухэтапная загрузка описания скилла** | Что | Что видно всегда | Что подгружается по требованию | |---|---|---| | Короткое описание | Попадает в System Prompt агента → он знает, что скилл существует | — | | Длинное описание | — | Только когда агент решил «мне нужен этот скилл» — он заходит в директорию и читает SKILL.md | Это позволяет иметь **очень много скиллов без переполнения контекста**. Пример: Hermes у автора начинался с 56 скиллов, через пару недель работы вырос до 100 — и всё равно работает. С тулами такое невозможно (2 запроса — и контекст закончился). **Стоимость создания:** - MCP-сервер: нужен разработчик. - Скилл: нужно уметь писать тексты (можно даже не на английском). Распространение — через мессенджер / GitHub / куда угодно. ### Skills vs MCP — когда что использовать | Ситуация | Что выбрать | |---|---| | Не знаешь, какие задачи будет решать агент | Skills | | Задачи разнообразные, разные тулы для разных сценариев | Skills | | Количество тулов 5–50 | Skills | | Агент узкоспециализированный, задачи однотипные | MCP | | Для каждой задачи нужен один и тот же набор тулов | MCP | | Мало тулов и агент решает однотипный поток задач | MCP | **Оговорка:** грань стирается. Например, Claude Code использует MCP не напрямую, а превращает их в скиллы (файлик подкладывается, функции сразу в контекст не попадают). В этом режиме минусы MCP во многом исчезают. ### Что автор считает «недостающим» в классическом скилле Как «архитектура фон Неймана без данных»: код есть, а данных нет. **Предложение — добавлять в скилл данные и историю использования прямо внутри git-репозитория.** Тогда скилл раскрывается как: - короткое описание - длинное описание - инструменты - **+ данные** --- ## Часть 4. Skill-first архитектура на базе git ### Почему именно git Git-репозиторий как контейнер скилла + данных даёт: 1. **Skill-first архитектура:** к одному скиллу можно подключить несколько разных агентов (Claude Code для больших операций, Hermes через Telegram для быстрых, OpenClaude — из любой точки). 2. **Встраивание в CI/CD:** пайплайн работает с тем же git-репозиторием. 3. **Совместная работа команды:** можно делиться скиллом с коллегами. 4. **Решение проблемы коллизий:** современные модели на харнессах научились решать merge-конфликты. Раньше нужен был человек — сейчас нет. Это позволяет строить системы с параллельной работой многих акторов **на голом git**, без транзакционной БД. (Не для платежей, конечно, но для многого — да.) ### Обязательные правила в AGENTS.md для такого скилла - **Всегда `git pull` в начале работы** (последние данные). - **Сразу `push` + `commit` после работы** (не терять правки). - **CI как «back-pressure» (обратное давление)** — обязательно прописать в AGENTS.md. Возвращает агента в рамки, если он начинает «расползаться» — придумывать себе новые задачи, отклоняться от того, что описано в AgentsMD. Без CI изменения накапливаются, агент уходит в свою сторону. --- ## Часть 5. Личные скиллы автора (ежедневное использование) ### Список скиллов | Скилл | Что делает | Особенность | |---|---|---| | ДНК / медицина | Анализ ДНК-тестов и секвенирования всей семьи | Разбирается ниже | | Рекомендации | Фильмы, музыка, игры | Основан на выгрузке ~1000 оценок с КиноНавигатора | | Планирование поездок | Командировки, документы, брони | Разбирается ниже | | HR / оценка резюме | Автоматическая оценка присланных резюме | Разбирается ниже | | Управление финансами | Мониторинг платежей, показания счётчиков, долги | — | | R&D по агентам (командный) | Исследование агентов, много людей одновременно | — | ### Скилл 1. ДНК и медицина **Данные:** - ДНК-тесты (Atlas, Genotek) на всех членов семьи - ДНК-секвенирование — ~100 ГБ прочитанного ДНК - По каждому человеку — шаблон: пол, возраст, вес, лекарства, особенности **Возможности:** - Задавать вопросы про себя: какие лекарства эффективнее, какие виды спорта подходят, стиль обучения - Сравнивать двух людей — кто более общительный, кто усидчивый (звучит как слоп, но работает) - Автоматическая сборка сырого ДНК в единую цепочку (у автора это заняло неделю руками — Claude сделал за сутки) - Скачивание референсного генома и сравнение - Дашборд в стиле компьютерной игры: перки, дебафы, распределение характеристик **Впечатляющий сценарий:** У каждого человека ~100 уникальных мутаций (из них 10 полезных, 10 вредных, 80 нейтральных в среднем). Большинство науке неизвестны. - Автор попросил Claude проанализировать конкретную мутацию. - Claude нашёл, что мутация не описана нигде. - Определил, к какому гену относится. - Сам обратился к **AlphaFold** (Google) — ИИ для рендеринга сворачивания белков. - Отрендерил белок автора и сделал вывод: белок сворачивается корректно, мутация ничего не значит. **Валидация:** - Автор сравнил разные ДНК-тесты одного человека (Atlas / Genotek / секвенирование) → совпадение 99.95%. Лаборатории не жульничают. **Контекст (важные истории «AI в медицине»):** - **Reddit-пользователь через ChatGPT + MRI-снимок** нашёл сложную взаимосвязь болей в спине с дефицитом B12. Пошёл к врачу — подтвердилось. История опубликована в блоге OpenAI. - **Пол Конингем** — его собака заболела раком. Он с помощью ChatGPT + AlphaFold **сам разработал индивидуальную мРНК-вакцину**, заказал печать в лаборатории, вколол собаке. **Собака была вылечена.** **Масштаб:** - Референсный геном человека: **3 млрд долларов, 13 лет** работы. - Свой полный геном сегодня: **~1000 долларов и один вечер** работы ноутбука + Claude. **«Домашняя работа над исходниками себя»** — то, что раньше было доступно только большой науке. ### Скилл 2. Планирование поездок **Структура скилла:** - Шаблон командировки - Список людей, которые могут поехать (со всеми документами) **Сценарий:** 1. Открыл Cursor → «создай мне поездку в Китай» 2. Ушёл, поехал домой 3. В Telegram (через Hermes или OpenClaude, подключённый к тому же скиллу) — фотография купленного билета 4. Агент делает `git pull`, добавляет билет в структуру поездки, кладёт PDF в директорию поездки, коммитит 5. В любой момент можно спросить: «что осталось по поездке?» — он ответит: «не забронирована гостиница, между самолётами 2 часа — даже не пытайся» **Автозаполнение** — успешно заполнил заявление на визу практически без ошибок. ### Скилл 3. HR / оценка резюме **Как возник:** стихийно. Автор кинул Hermes'у резюме (картинка без текстового слоя), сказал «оцени». - Hermes подтянул OCR - Первая оценка была нерелевантной - Автор давал фидбэк на каждой итерации: - «человек ищет только удалёнку, а у нас гибрид — таких не рассматриваем» - «когда у человека есть GitHub, обязательно заходи, анализируй код, оценивай impact в open source» - **10–20 итераций** — скилл сам себя корректировал **Результат:** «идеальный HR-скилл». Кидаешь резюме → получаешь ответ → соглашаешься, если смотришь глазами. **Ошибок ~10%.** **Правовая оговорка:** резюме приходят напрямую в личку → есть моральное право на обработку. Закон о персональных данных соблюдён. --- ## Часть 6. Автоулучшение скиллов (пример Hermes) Hermes построен **полностью вокруг скиллов** — не только использует, но и создаёт их автономно. ### Критерий автосоздания скилла Если Hermes на какую-то задачу потратил **>5 tool calls**, он сразу рассматривает: «а не стоит ли это запомнить как скилл». ### Механизм куратора (два слоя) 1. **Прунинг (обрезание неиспользуемого)** - Скилл не использовался **30 дней** → он делается неактивным (в системе есть, но его description не подкладывается или подкладывается уменьшенным). - Скилл не использовался **90 дней** → архивируется, полностью исчезает из системы. 2. **Консолидация (раз в 7 дней)** - Анализирует, можно ли попарно объединить мелкие скиллы в более крупный. - Не даёт системе раздуться до тысяч скиллов, чьи «короткие описания» съедят весь контекст. ### Итог Скиллы **эволюционируют автоматически**. Если они ещё и с данными — они становятся основой системы и **новой памятью агента**. Раньше память делали на: - поиск в переписках - RAG на извлечении фактов о пользователе Теперь **вся информация о пользователе лежит в скиллах**, подгружается ровно тогда, когда скилл активирован, и харнесс сам решает, что попадёт в контекст (а не RAG «за него» до начала работы модели). --- ## Часть 7. Агентные циклы (три уровня) Это следующая большая тема после харнессов. По прогнозу автора — «стрельнёт» в 2027. ### Уровень 1: Inner Loop (React-цикл внутри харнесса) Задача → вызов тулов → ... → решено → текстовый ответ. Классика. ### Уровень 2: Outer Loop / Ralph Loop (придумал Джеффри Хантли) Харнесс засунут в бесконечный `while true`: ```bash while true; do claude --dangerously-skip-permissions -p "реши задачу" || true done ``` Позволяет агенту работать днями/неделями. Хитрости против «слопа»: - **Back-pressure через CI/CD** — если агент слетает с катушек, CI возвращает его - **Валидация качества кода** **Почему это работает:** - Позволяет работать **без раста контекста**. - Когда контекст растёт → в какой-то момент кончается → суммаризация → потеря данных → **агент тупеет** (кто пользовался OpenClaude — «сегодня решил задачу, завтра ту же задачу забыл»). - У модели есть **смарт-зона** — примерно первая треть контекста, где она максимально «умная». Дальше — глупеет, даже если у неё миллионный контекст. - Ralph Loop позволяет **постоянно оставаться в смарт-зоне**. ### Уровень 3: Meta Loop (авторский, не общепринятый) Проблема, подсвеченная **Андреем Карпатым** — **схлопывание (collapse)**. Если давать модели одну и ту же задачу постоянно, она «решает разными способами», но фактически всеми одним и тем же способом с разными словами. **Пример Карпатого:** попросите модель рассказать анекдот, потом ещё один, потом ещё. На пятый раз — тот же анекдот, только место действия и герои другие. **Решение (авторское Meta Loop):** - В какой-то момент **полностью останавливаем цикл** - **Полностью зачищаем все данные, которые агент создал** - Данные складываем в архив, который агент изначально не видит - Запускаем цикл с чистого листа → агент идёт другим путём - Через какое-то время он находит архив, распаковывает, обнаруживает свои прошлые данные → но уже пошёл в другую сторону - Это позволяет **исследовать задачу в разных направлениях** Хорошо для исследовательских задач, когда сам до конца не понимаешь, что решаешь. ### Пример Ralph Loop в коде ```bash while true; do claude "реши задачу" # inner loop внутри done # outer loop = Ralph # meta loop уже не в коде ``` --- ## Часть 8. Q&A — важные тезисы ### Про фундаментальность скиллов - Ничего фундаментального в LLM-движухе нет. - Полгода — и всё меняется. - Корпорации страдают: «утвердили MCP на архкоме → все хотят A2A → утвердили A2A → снова поменялось». ### Кого автор нанимает - Команда R&D, поэтому смотрит на: - **Широкий технический кругозор** - **Автономность** — full-stack, сам может найти задачу, прикопать, решить - Знания по агентам «доберёт в процессе». - Круто, если есть **фундаментальная математика и понимание устройства обучения**, но не стоп-фактор. ### Какие данные класть в скилл (нет стандартов) - Пока — только интуиция и статистика использования. - Автор в геномный скилл кладёт **200 ГБ данных**, в скилл поездок — **100 КБ**. Оба работают одинаково хорошо. - «Потолок сверху ещё не нащупал.» Харнессы умные — насыщение данными скилл **не убивает** (в отличие от RAG и классических промптов). ### Что ещё можно добавить в архитектуру агента (вопрос из зала) - Слушатель предложил концепцию: LLM → tools → skills → auto-improvement → «больше ничего добавить нельзя?» - Автор: **не хватает восприятия мира / квалиа**. - Пример: «до автомойки 5 минут ехать или 10 минут идти пешком — как лучше?» Нейронка отвечает: «Пешочком сходите, всего 5 минут». Не понимает, что без машины на автомойке делать нечего. - **Возможно помогут world-models** (модели мира), но как их сделать — открытый вопрос. ### Прикладной пример: авто-улучшение агента Автор построил скилл, где: - **Данные:** бенчмарк, который надо улучшить + код агента - **Задача агенту:** улучшай себя на бенчмарке в цикле - Идея взята у Карпатого (репозиторий назывался «autoagent»): - Агент выдвигает гипотезу - Меряет бенчмарк - Хорошая гипотеза → фиксирует - Плохая → откатывает - **Стартовая база:** слабый ГигаЧат, решал 1 из 89 задач бенча - **Результат за выходные:** **11 задач из 89** - **Рост в 11 раз.** - Автор проверил всё — «сделал адекватно, нигде не заоверфитился». --- ## Сквозные принципы доклада 1. **Простота бьёт сложность.** Универсальный агент с ~10 функциями работы с файлами делает больше, чем сложный мультиграф. 2. **Задачи разные — способ обработки одинаковый.** Один харнесс на всё. 3. **Данные должны жить рядом с инструментами.** Скилл без данных — как «фон Нейман без данных». 4. **Git — универсальный контейнер** для скилла + данных + истории + коллаборации. 5. **Контекст — самый ценный ресурс.** Двухэтапная загрузка скиллов, back-pressure через CI, оставаться в смарт-зоне. 6. **Автономность важнее контроля.** Human-in-the-middle → man-on-the-middle → AI factory. 7. **Автоулучшение обязательно.** Куратор, прунинг, консолидация, генерация новых скиллов. 8. **Циклы — новая парадигма.** Inner + Outer (Ralph) + Meta. 9. **Ничего фундаментального нет.** Готовьтесь переучиваться каждые полгода. --- ## Actionable takeaways для практика 1. **Строй агентов на харнессах** (Claude Code / OpenClaude / Hermes / Cursor). Это уже must-have. 2. **Не переходи с ходу на MCP** — оцени: количество тулов 5–50 → скиллы. >50 однотипных → MCP. 3. **Клади данные в тот же git-репозиторий, где скилл.** Это не убьёт агента. 4. **Прописывай в AGENTS.md жёсткие правила:** - `git pull` в начале - `push` + `commit` в конце - CI как back-pressure 5. **Автоматизируй создание скиллов** — если задача съела >5 tool calls, это кандидат в скилл. 6. **Внедри куратора:** прунинг неиспользуемого (30/90 дней), консолидация раз в неделю. 7. **Оборачивай агента в Ralph Loop** для многодневных задач: избегай раста контекста и суммаризации. 8. **Держи агента в первой трети контекста** (смарт-зона), даже если у модели миллионный контекст. 9. **Для исследовательских задач** — Meta Loop: периодически сноси всё в архив, стартуй с нуля. 10. **Хочешь стать HR/медиком/финансистом для себя?** Начни с одного скилла с данными по своему кейсу. Итерируй фидбэком — через 10–20 циклов будет работать. --- ## Кому полезно - **Разработчикам агентов** — карта перехода от tools → MCP → skills и практическая схема хранения в git. - **Тимлидам R&D** — фреймворк оценки: скиллы vs MCP, back-pressure через CI, куратор. - **Продактам AI-продуктов** — понимание, куда движется парадигма (skill-first архитектура, harness как бэкенд, memory-as-skills). - **Индивидуальным biohacker'ам / self-quantifiers** — реальный кейс «Claude + AlphaFold над своим ДНК за $1000 и вечер». - **Всем, кто участвует в AI-хакатонах** — 19 из 20 победителей уже строят решения на харнессах. Догоняйте.