36 KiB
#ai #agents #video #webinar
Выводы по видео
Источник: https://www.youtube.com/watch?v=a-NIeMB-Hj8 Название: Скиллы на базе git — новая память AI-агентов. Мой опыт Автор: Константин (Сбер, команда разработки ГигаЧата, R&D по агентам) Длительность: 53:09
Главный тезис
Скиллы, объединённые с данными пользователя и алгоритмами автоулучшения — это новая память AI-агентов, к которой все агентные системы в итоге придут. Это не просто «набор навыков», это принципиально новая архитектура памяти, в которой:
- инструменты (как их вызывать)
- данные (то, над чем работаем)
- история использования (что уже сделано)
лежат вместе в одном git-репозитории, и харнесс сам решает, что подгружать в контекст в конкретный момент.
Автор ведёт слушателя от исторического рекапа к практическому опыту и заканчивает моделью «трёхуровневого агентного цикла», который, по его прогнозу, будет доминировать в 2027.
Часть 1. Рекап эволюции агентов (как мы пришли к харнессам)
Таймлайн
| Период | Что появилось | Что это дало |
|---|---|---|
| Начало 2023 | LLM / ChatGPT (не чатовая) — задал вопрос, получил ответ | Нет памяти, нет инструментов, одноходовой обмен |
| Лето 2023 | Концепция ReAct-агентов — LLM может либо ответить текстом, либо вызвать функцию | Впервые появился «агентный цикл»: вызов инструментов → рефлексия → изменение поведения. Мир научился давать LLM обратную связь через tools |
| 2023–2024 | Цепочки вызовов, роли, первые агентные SDK, векторные БД, RAG, JSON-структурированные ответы | Агент становится сложнее, начал использовать внешние знания |
| 2024 | Цепочки → графы. LangGraph. Мультиагентные подходы (агент-планировщик, агент-критик, третий агент отвечает). Фреймворки: AutoGen, CrewAI. Скаффолдинг — сложная конструкция вокруг LLM | Пик технической сложности агентов |
| Конец 2025 | Внезапное упрощение. Оказалось, что достаточно простого агента с ~10 базовыми функциями работы с файлами, чтобы решать сложные задачи. Начало эпохи универсальных агентов = харнессов | Резкое снижение сложности при росте возможностей |
| 2026 (сейчас) | Универсальные агенты (харнессы) вкладываются во внешние циклы (Ralph loop), запускаются на дни/недели. Появляется AI factory (полностью автономная работа без human-in-the-loop) | Human-in-the-middle → man-on-the-middle → полное отсутствие человека |
| 2027 (прогноз) | Доминирование скиллов + агентных циклов | — |
Эволюция ролей человека
- Prompt-инженер (текстовое описание задачи) → Context-инженер (сложный prompt с памятью, RAG, структурами) → Harness-строитель (архитектура харнесса, политики, песочница) → сейчас поднимается Loop-инженер (построение циклов вокруг агента: CI/CD, back-pressure, метациклы)
Ключевая мысль этой части
«За полгода всё меняется». Ничего фундаментального в этой сфере пока нет. Только что утвердили MCP — уже все хотят A2A. Корпорации от этого страдают.
Часть 2. Что такое харнесс
Определение и метафора
Харнесс (в переводе — упряжка) = агент + инструменты. LLM — источник силы. Набор инструментов — упряжка. Поле задач — данные. LLM, запряжённая в инструменты, «тянет их по пространству данных», превращая необработанные задачи в решённые.
Важно: задачи разные, а способ их обработки одинаковый — одна и та же упряжка (харнесс) решает большое количество разнородных задач.
Стандартный набор инструментов харнесса (~30–40 max)
| Категория | Инструменты |
|---|---|
| Файлы | Read, Edit, Write |
| Shell | Bash |
| Поиск | Grep, Glob, WebSearch |
| Планирование | TodoWrite/TodoRead |
| Расширение | Спавн субагентов |
Предел: >30–40 встроенных тулов не встречается ни в одном популярном харнессе. Больше 100 — LLM (даже Fable 5) начинает путаться, и контекст уходит с огромной скоростью, потому что каждый тул подкладывается в вызов.
Из чего состоит хороший харнесс
- Короткий system prompt («используй инструменты, чтобы решить задачу»). Чем короче — тем лучше.
- Набор стандартных тулов (см. выше).
- Runtime loop — тот же ReAct-цикл: вызывай тулы, пока не решишь.
- Управление контекстом — своевременная суммаризация, запуск субагентов без передачи полного контекста.
- Стандартизованные ключевые файлы — AGENTS.md, CLAUDE.md, GEMINI.md для описания проекта; директории
skills/соSKILL.md; подключение MCP-серверов. - Устойчивость к нештатным ситуациям — обрывам соединения, ошибкам ОС, отключению VPN.
- Интерфейс — консольный CLI, чат, мессенджер.
Два режима работы харнесса (де-факто стандарт)
| Режим | Описание | Термин |
|---|---|---|
| Интерактивный | Постоянные уточнения у человека («можно я прочту этот файл?») | Human-in-the-middle → man-on-the-middle (человек уже не контролирует, а лишь присматривает) |
| Автономный (fire-and-forget) | Запуск через CLI с задачей аргументом; агент решает и возвращает результат | Позволяет встраивать харнессы в CI/CD и строить цепочки последовательных вызовов |
Популярные харнессы
- Claude Code
- Codex CLI
- Cursor (в каком-то смысле)
- OpenClaude (форк Claude Code)
- Hermes — построен полностью вокруг скиллов
- И почти все агенты «последнего поколения»
Личный опыт: харнессы — must-have (три хакатона)
| Хакатон | Результат | Технология |
|---|---|---|
| Interpress-Ex Challenge | 7 место | Свой харнесс, запущенный в бесконечном цикле на выходные. Ни одну задачу глазами не читал — просто оставил агента работать |
| Snowbase Camp | 3 место общее / 1 по техническим метрикам | Утечённый Claude Code в качестве бэкенда + красивый фронт. Идеально, когда задача плохо понятна заранее |
| BitGen | ~топ-20 | Обнаружил инсайт: 19 из 20 команд-топов делали свои решения на харнессах. Все, кто участвует в интересных хакатонах, уже перешли на них |
Часть 3. Эволюция инструментов агентов
Три поколения
Tools (2022–2024) → MCP (кон.2024–2025) → Skills (2025→)
Tools (2022–2024)
- Функция, помеченная тегом, подкладывается в вызов модели.
- Каждый тул попадает в контекст.
- Библиотеки от LangChain, LlamaIndex.
- Проблема: приходилось каждый раз писать или адаптировать самому.
MCP-серверы (конец 2024 → 2025, Anthropic)
- Локально развёрнутый сервер, подключаемый к агенту стандартным протоколом.
- К агенту сразу добавляется несколько готовых тулов.
- Появились маркетплейсы MCP.
- Проблемы:
- Многие MCP содержат десятки тулов → быстро съедается контекст (>100 функций = хаос).
- Безопасность: если сервер подгружается по сети, поведение агента может неожиданно измениться.
- Автор не хейтит MCP — проблемы во многом уже решены, MCP имеет право на жизнь.
Skills (2025 →) — главная тема доклада
Скилл = директория + джентльменское соглашение.
Состав:
SKILL.md— как работает этот скилл- Инструменты (bash-скрипты, Python-код) в той же директории
- (новое предложение автора) — данные прямо в этой же директории
Ключевое преимущество: двухэтапная загрузка описания скилла
| Что | Что видно всегда | Что подгружается по требованию |
|---|---|---|
| Короткое описание | Попадает в System Prompt агента → он знает, что скилл существует | — |
| Длинное описание | — | Только когда агент решил «мне нужен этот скилл» — он заходит в директорию и читает SKILL.md |
Это позволяет иметь очень много скиллов без переполнения контекста. Пример: Hermes у автора начинался с 56 скиллов, через пару недель работы вырос до 100 — и всё равно работает. С тулами такое невозможно (2 запроса — и контекст закончился).
Стоимость создания:
- MCP-сервер: нужен разработчик.
- Скилл: нужно уметь писать тексты (можно даже не на английском). Распространение — через мессенджер / GitHub / куда угодно.
Skills vs MCP — когда что использовать
| Ситуация | Что выбрать |
|---|---|
| Не знаешь, какие задачи будет решать агент | Skills |
| Задачи разнообразные, разные тулы для разных сценариев | Skills |
| Количество тулов 5–50 | Skills |
| Агент узкоспециализированный, задачи однотипные | MCP |
| Для каждой задачи нужен один и тот же набор тулов | MCP |
| Мало тулов и агент решает однотипный поток задач | MCP |
Оговорка: грань стирается. Например, Claude Code использует MCP не напрямую, а превращает их в скиллы (файлик подкладывается, функции сразу в контекст не попадают). В этом режиме минусы MCP во многом исчезают.
Что автор считает «недостающим» в классическом скилле
Как «архитектура фон Неймана без данных»: код есть, а данных нет. Предложение — добавлять в скилл данные и историю использования прямо внутри git-репозитория.
Тогда скилл раскрывается как:
- короткое описание
- длинное описание
- инструменты
- + данные
Часть 4. Skill-first архитектура на базе git
Почему именно git
Git-репозиторий как контейнер скилла + данных даёт:
- Skill-first архитектура: к одному скиллу можно подключить несколько разных агентов (Claude Code для больших операций, Hermes через Telegram для быстрых, OpenClaude — из любой точки).
- Встраивание в CI/CD: пайплайн работает с тем же git-репозиторием.
- Совместная работа команды: можно делиться скиллом с коллегами.
- Решение проблемы коллизий: современные модели на харнессах научились решать merge-конфликты. Раньше нужен был человек — сейчас нет. Это позволяет строить системы с параллельной работой многих акторов на голом git, без транзакционной БД. (Не для платежей, конечно, но для многого — да.)
Обязательные правила в AGENTS.md для такого скилла
- Всегда
git pullв начале работы (последние данные). - Сразу
push+commitпосле работы (не терять правки). - CI как «back-pressure» (обратное давление) — обязательно прописать в AGENTS.md. Возвращает агента в рамки, если он начинает «расползаться» — придумывать себе новые задачи, отклоняться от того, что описано в AgentsMD. Без CI изменения накапливаются, агент уходит в свою сторону.
Часть 5. Личные скиллы автора (ежедневное использование)
Список скиллов
| Скилл | Что делает | Особенность |
|---|---|---|
| ДНК / медицина | Анализ ДНК-тестов и секвенирования всей семьи | Разбирается ниже |
| Рекомендации | Фильмы, музыка, игры | Основан на выгрузке ~1000 оценок с КиноНавигатора |
| Планирование поездок | Командировки, документы, брони | Разбирается ниже |
| HR / оценка резюме | Автоматическая оценка присланных резюме | Разбирается ниже |
| Управление финансами | Мониторинг платежей, показания счётчиков, долги | — |
| R&D по агентам (командный) | Исследование агентов, много людей одновременно | — |
Скилл 1. ДНК и медицина
Данные:
- ДНК-тесты (Atlas, Genotek) на всех членов семьи
- ДНК-секвенирование — ~100 ГБ прочитанного ДНК
- По каждому человеку — шаблон: пол, возраст, вес, лекарства, особенности
Возможности:
- Задавать вопросы про себя: какие лекарства эффективнее, какие виды спорта подходят, стиль обучения
- Сравнивать двух людей — кто более общительный, кто усидчивый (звучит как слоп, но работает)
- Автоматическая сборка сырого ДНК в единую цепочку (у автора это заняло неделю руками — Claude сделал за сутки)
- Скачивание референсного генома и сравнение
- Дашборд в стиле компьютерной игры: перки, дебафы, распределение характеристик
Впечатляющий сценарий: У каждого человека ~100 уникальных мутаций (из них 10 полезных, 10 вредных, 80 нейтральных в среднем). Большинство науке неизвестны.
- Автор попросил Claude проанализировать конкретную мутацию.
- Claude нашёл, что мутация не описана нигде.
- Определил, к какому гену относится.
- Сам обратился к AlphaFold (Google) — ИИ для рендеринга сворачивания белков.
- Отрендерил белок автора и сделал вывод: белок сворачивается корректно, мутация ничего не значит.
Валидация:
- Автор сравнил разные ДНК-тесты одного человека (Atlas / Genotek / секвенирование) → совпадение 99.95%. Лаборатории не жульничают.
Контекст (важные истории «AI в медицине»):
- Reddit-пользователь через ChatGPT + MRI-снимок нашёл сложную взаимосвязь болей в спине с дефицитом B12. Пошёл к врачу — подтвердилось. История опубликована в блоге OpenAI.
- Пол Конингем — его собака заболела раком. Он с помощью ChatGPT + AlphaFold сам разработал индивидуальную мРНК-вакцину, заказал печать в лаборатории, вколол собаке. Собака была вылечена.
Масштаб:
- Референсный геном человека: 3 млрд долларов, 13 лет работы.
- Свой полный геном сегодня: ~1000 долларов и один вечер работы ноутбука + Claude.
«Домашняя работа над исходниками себя» — то, что раньше было доступно только большой науке.
Скилл 2. Планирование поездок
Структура скилла:
- Шаблон командировки
- Список людей, которые могут поехать (со всеми документами)
Сценарий:
- Открыл Cursor → «создай мне поездку в Китай»
- Ушёл, поехал домой
- В Telegram (через Hermes или OpenClaude, подключённый к тому же скиллу) — фотография купленного билета
- Агент делает
git pull, добавляет билет в структуру поездки, кладёт PDF в директорию поездки, коммитит - В любой момент можно спросить: «что осталось по поездке?» — он ответит: «не забронирована гостиница, между самолётами 2 часа — даже не пытайся»
Автозаполнение — успешно заполнил заявление на визу практически без ошибок.
Скилл 3. HR / оценка резюме
Как возник: стихийно. Автор кинул Hermes'у резюме (картинка без текстового слоя), сказал «оцени».
- Hermes подтянул OCR
- Первая оценка была нерелевантной
- Автор давал фидбэк на каждой итерации:
- «человек ищет только удалёнку, а у нас гибрид — таких не рассматриваем»
- «когда у человека есть GitHub, обязательно заходи, анализируй код, оценивай impact в open source»
- 10–20 итераций — скилл сам себя корректировал
Результат: «идеальный HR-скилл». Кидаешь резюме → получаешь ответ → соглашаешься, если смотришь глазами. Ошибок ~10%.
Правовая оговорка: резюме приходят напрямую в личку → есть моральное право на обработку. Закон о персональных данных соблюдён.
Часть 6. Автоулучшение скиллов (пример Hermes)
Hermes построен полностью вокруг скиллов — не только использует, но и создаёт их автономно.
Критерий автосоздания скилла
Если Hermes на какую-то задачу потратил >5 tool calls, он сразу рассматривает: «а не стоит ли это запомнить как скилл».
Механизм куратора (два слоя)
-
Прунинг (обрезание неиспользуемого)
- Скилл не использовался 30 дней → он делается неактивным (в системе есть, но его description не подкладывается или подкладывается уменьшенным).
- Скилл не использовался 90 дней → архивируется, полностью исчезает из системы.
-
Консолидация (раз в 7 дней)
- Анализирует, можно ли попарно объединить мелкие скиллы в более крупный.
- Не даёт системе раздуться до тысяч скиллов, чьи «короткие описания» съедят весь контекст.
Итог
Скиллы эволюционируют автоматически. Если они ещё и с данными — они становятся основой системы и новой памятью агента.
Раньше память делали на:
- поиск в переписках
- RAG на извлечении фактов о пользователе
Теперь вся информация о пользователе лежит в скиллах, подгружается ровно тогда, когда скилл активирован, и харнесс сам решает, что попадёт в контекст (а не RAG «за него» до начала работы модели).
Часть 7. Агентные циклы (три уровня)
Это следующая большая тема после харнессов. По прогнозу автора — «стрельнёт» в 2027.
Уровень 1: Inner Loop (React-цикл внутри харнесса)
Задача → вызов тулов → ... → решено → текстовый ответ. Классика.
Уровень 2: Outer Loop / Ralph Loop (придумал Джеффри Хантли)
Харнесс засунут в бесконечный while true:
while true; do
claude --dangerously-skip-permissions -p "реши задачу" || true
done
Позволяет агенту работать днями/неделями. Хитрости против «слопа»:
- Back-pressure через CI/CD — если агент слетает с катушек, CI возвращает его
- Валидация качества кода
Почему это работает:
- Позволяет работать без раста контекста.
- Когда контекст растёт → в какой-то момент кончается → суммаризация → потеря данных → агент тупеет (кто пользовался OpenClaude — «сегодня решил задачу, завтра ту же задачу забыл»).
- У модели есть смарт-зона — примерно первая треть контекста, где она максимально «умная». Дальше — глупеет, даже если у неё миллионный контекст.
- Ralph Loop позволяет постоянно оставаться в смарт-зоне.
Уровень 3: Meta Loop (авторский, не общепринятый)
Проблема, подсвеченная Андреем Карпатым — схлопывание (collapse). Если давать модели одну и ту же задачу постоянно, она «решает разными способами», но фактически всеми одним и тем же способом с разными словами.
Пример Карпатого: попросите модель рассказать анекдот, потом ещё один, потом ещё. На пятый раз — тот же анекдот, только место действия и герои другие.
Решение (авторское Meta Loop):
- В какой-то момент полностью останавливаем цикл
- Полностью зачищаем все данные, которые агент создал
- Данные складываем в архив, который агент изначально не видит
- Запускаем цикл с чистого листа → агент идёт другим путём
- Через какое-то время он находит архив, распаковывает, обнаруживает свои прошлые данные → но уже пошёл в другую сторону
- Это позволяет исследовать задачу в разных направлениях
Хорошо для исследовательских задач, когда сам до конца не понимаешь, что решаешь.
Пример Ralph Loop в коде
while true; do
claude "реши задачу" # inner loop внутри
done # outer loop = Ralph
# meta loop уже не в коде
Часть 8. Q&A — важные тезисы
Про фундаментальность скиллов
- Ничего фундаментального в LLM-движухе нет.
- Полгода — и всё меняется.
- Корпорации страдают: «утвердили MCP на архкоме → все хотят A2A → утвердили A2A → снова поменялось».
Кого автор нанимает
- Команда R&D, поэтому смотрит на:
- Широкий технический кругозор
- Автономность — full-stack, сам может найти задачу, прикопать, решить
- Знания по агентам «доберёт в процессе».
- Круто, если есть фундаментальная математика и понимание устройства обучения, но не стоп-фактор.
Какие данные класть в скилл (нет стандартов)
- Пока — только интуиция и статистика использования.
- Автор в геномный скилл кладёт 200 ГБ данных, в скилл поездок — 100 КБ. Оба работают одинаково хорошо.
- «Потолок сверху ещё не нащупал.» Харнессы умные — насыщение данными скилл не убивает (в отличие от RAG и классических промптов).
Что ещё можно добавить в архитектуру агента (вопрос из зала)
- Слушатель предложил концепцию: LLM → tools → skills → auto-improvement → «больше ничего добавить нельзя?»
- Автор: не хватает восприятия мира / квалиа.
- Пример: «до автомойки 5 минут ехать или 10 минут идти пешком — как лучше?» Нейронка отвечает: «Пешочком сходите, всего 5 минут». Не понимает, что без машины на автомойке делать нечего.
- Возможно помогут world-models (модели мира), но как их сделать — открытый вопрос.
Прикладной пример: авто-улучшение агента
Автор построил скилл, где:
- Данные: бенчмарк, который надо улучшить + код агента
- Задача агенту: улучшай себя на бенчмарке в цикле
- Идея взята у Карпатого (репозиторий назывался «autoagent»):
- Агент выдвигает гипотезу
- Меряет бенчмарк
- Хорошая гипотеза → фиксирует
- Плохая → откатывает
- Стартовая база: слабый ГигаЧат, решал 1 из 89 задач бенча
- Результат за выходные: 11 задач из 89
- Рост в 11 раз.
- Автор проверил всё — «сделал адекватно, нигде не заоверфитился».
Сквозные принципы доклада
- Простота бьёт сложность. Универсальный агент с ~10 функциями работы с файлами делает больше, чем сложный мультиграф.
- Задачи разные — способ обработки одинаковый. Один харнесс на всё.
- Данные должны жить рядом с инструментами. Скилл без данных — как «фон Нейман без данных».
- Git — универсальный контейнер для скилла + данных + истории + коллаборации.
- Контекст — самый ценный ресурс. Двухэтапная загрузка скиллов, back-pressure через CI, оставаться в смарт-зоне.
- Автономность важнее контроля. Human-in-the-middle → man-on-the-middle → AI factory.
- Автоулучшение обязательно. Куратор, прунинг, консолидация, генерация новых скиллов.
- Циклы — новая парадигма. Inner + Outer (Ralph) + Meta.
- Ничего фундаментального нет. Готовьтесь переучиваться каждые полгода.
Actionable takeaways для практика
- Строй агентов на харнессах (Claude Code / OpenClaude / Hermes / Cursor). Это уже must-have.
- Не переходи с ходу на MCP — оцени: количество тулов 5–50 → скиллы. >50 однотипных → MCP.
- Клади данные в тот же git-репозиторий, где скилл. Это не убьёт агента.
- Прописывай в AGENTS.md жёсткие правила:
git pullв началеpush+commitв конце- CI как back-pressure
- Автоматизируй создание скиллов — если задача съела >5 tool calls, это кандидат в скилл.
- Внедри куратора: прунинг неиспользуемого (30/90 дней), консолидация раз в неделю.
- Оборачивай агента в Ralph Loop для многодневных задач: избегай раста контекста и суммаризации.
- Держи агента в первой трети контекста (смарт-зона), даже если у модели миллионный контекст.
- Для исследовательских задач — Meta Loop: периодически сноси всё в архив, стартуй с нуля.
- Хочешь стать HR/медиком/финансистом для себя? Начни с одного скилла с данными по своему кейсу. Итерируй фидбэком — через 10–20 циклов будет работать.
Кому полезно
- Разработчикам агентов — карта перехода от tools → MCP → skills и практическая схема хранения в git.
- Тимлидам R&D — фреймворк оценки: скиллы vs MCP, back-pressure через CI, куратор.
- Продактам AI-продуктов — понимание, куда движется парадигма (skill-first архитектура, harness как бэкенд, memory-as-skills).
- Индивидуальным biohacker'ам / self-quantifiers — реальный кейс «Claude + AlphaFold над своим ДНК за $1000 и вечер».
- Всем, кто участвует в AI-хакатонах — 19 из 20 победителей уже строят решения на харнессах. Догоняйте.