Files
WebinarNotes/raw/sources/Скиллы на базе git — новая память AI-агентов.md

36 KiB
Raw Blame History

#ai #agents #video #webinar

Выводы по видео

Источник: https://www.youtube.com/watch?v=a-NIeMB-Hj8 Название: Скиллы на базе git — новая память AI-агентов. Мой опыт Автор: Константин (Сбер, команда разработки ГигаЧата, R&D по агентам) Длительность: 53:09


Главный тезис

Скиллы, объединённые с данными пользователя и алгоритмами автоулучшения — это новая память AI-агентов, к которой все агентные системы в итоге придут. Это не просто «набор навыков», это принципиально новая архитектура памяти, в которой:

  • инструменты (как их вызывать)
  • данные (то, над чем работаем)
  • история использования (что уже сделано)

лежат вместе в одном git-репозитории, и харнесс сам решает, что подгружать в контекст в конкретный момент.

Автор ведёт слушателя от исторического рекапа к практическому опыту и заканчивает моделью «трёхуровневого агентного цикла», который, по его прогнозу, будет доминировать в 2027.


Часть 1. Рекап эволюции агентов (как мы пришли к харнессам)

Таймлайн

Период Что появилось Что это дало
Начало 2023 LLM / ChatGPT (не чатовая) — задал вопрос, получил ответ Нет памяти, нет инструментов, одноходовой обмен
Лето 2023 Концепция ReAct-агентов — LLM может либо ответить текстом, либо вызвать функцию Впервые появился «агентный цикл»: вызов инструментов → рефлексия → изменение поведения. Мир научился давать LLM обратную связь через tools
20232024 Цепочки вызовов, роли, первые агентные SDK, векторные БД, RAG, JSON-структурированные ответы Агент становится сложнее, начал использовать внешние знания
2024 Цепочки → графы. LangGraph. Мультиагентные подходы (агент-планировщик, агент-критик, третий агент отвечает). Фреймворки: AutoGen, CrewAI. Скаффолдинг — сложная конструкция вокруг LLM Пик технической сложности агентов
Конец 2025 Внезапное упрощение. Оказалось, что достаточно простого агента с ~10 базовыми функциями работы с файлами, чтобы решать сложные задачи. Начало эпохи универсальных агентов = харнессов Резкое снижение сложности при росте возможностей
2026 (сейчас) Универсальные агенты (харнессы) вкладываются во внешние циклы (Ralph loop), запускаются на дни/недели. Появляется AI factory (полностью автономная работа без human-in-the-loop) Human-in-the-middle → man-on-the-middle → полное отсутствие человека
2027 (прогноз) Доминирование скиллов + агентных циклов

Эволюция ролей человека

  • Prompt-инженер (текстовое описание задачи) → Context-инженер (сложный prompt с памятью, RAG, структурами) → Harness-строитель (архитектура харнесса, политики, песочница) → сейчас поднимается Loop-инженер (построение циклов вокруг агента: CI/CD, back-pressure, метациклы)

Ключевая мысль этой части

«За полгода всё меняется». Ничего фундаментального в этой сфере пока нет. Только что утвердили MCP — уже все хотят A2A. Корпорации от этого страдают.


Часть 2. Что такое харнесс

Определение и метафора

Харнесс (в переводе — упряжка) = агент + инструменты. LLM — источник силы. Набор инструментов — упряжка. Поле задач — данные. LLM, запряжённая в инструменты, «тянет их по пространству данных», превращая необработанные задачи в решённые.

Важно: задачи разные, а способ их обработки одинаковый — одна и та же упряжка (харнесс) решает большое количество разнородных задач.

Стандартный набор инструментов харнесса (~3040 max)

Категория Инструменты
Файлы Read, Edit, Write
Shell Bash
Поиск Grep, Glob, WebSearch
Планирование TodoWrite/TodoRead
Расширение Спавн субагентов

Предел: >3040 встроенных тулов не встречается ни в одном популярном харнессе. Больше 100 — LLM (даже Fable 5) начинает путаться, и контекст уходит с огромной скоростью, потому что каждый тул подкладывается в вызов.

Из чего состоит хороший харнесс

  1. Короткий system prompt («используй инструменты, чтобы решить задачу»). Чем короче — тем лучше.
  2. Набор стандартных тулов (см. выше).
  3. Runtime loop — тот же ReAct-цикл: вызывай тулы, пока не решишь.
  4. Управление контекстом — своевременная суммаризация, запуск субагентов без передачи полного контекста.
  5. Стандартизованные ключевые файлы — AGENTS.md, CLAUDE.md, GEMINI.md для описания проекта; директории skills/ со SKILL.md; подключение MCP-серверов.
  6. Устойчивость к нештатным ситуациям — обрывам соединения, ошибкам ОС, отключению VPN.
  7. Интерфейс — консольный CLI, чат, мессенджер.

Два режима работы харнесса (де-факто стандарт)

Режим Описание Термин
Интерактивный Постоянные уточнения у человека («можно я прочту этот файл?») Human-in-the-middle → man-on-the-middle (человек уже не контролирует, а лишь присматривает)
Автономный (fire-and-forget) Запуск через CLI с задачей аргументом; агент решает и возвращает результат Позволяет встраивать харнессы в CI/CD и строить цепочки последовательных вызовов

Популярные харнессы

  • Claude Code
  • Codex CLI
  • Cursor (в каком-то смысле)
  • OpenClaude (форк Claude Code)
  • Hermes — построен полностью вокруг скиллов
  • И почти все агенты «последнего поколения»

Личный опыт: харнессы — must-have (три хакатона)

Хакатон Результат Технология
Interpress-Ex Challenge 7 место Свой харнесс, запущенный в бесконечном цикле на выходные. Ни одну задачу глазами не читал — просто оставил агента работать
Snowbase Camp 3 место общее / 1 по техническим метрикам Утечённый Claude Code в качестве бэкенда + красивый фронт. Идеально, когда задача плохо понятна заранее
BitGen ~топ-20 Обнаружил инсайт: 19 из 20 команд-топов делали свои решения на харнессах. Все, кто участвует в интересных хакатонах, уже перешли на них

Часть 3. Эволюция инструментов агентов

Три поколения

Tools (20222024) → MCP (кон.20242025) → Skills (2025→)

Tools (20222024)

  • Функция, помеченная тегом, подкладывается в вызов модели.
  • Каждый тул попадает в контекст.
  • Библиотеки от LangChain, LlamaIndex.
  • Проблема: приходилось каждый раз писать или адаптировать самому.

MCP-серверы (конец 2024 → 2025, Anthropic)

  • Локально развёрнутый сервер, подключаемый к агенту стандартным протоколом.
  • К агенту сразу добавляется несколько готовых тулов.
  • Появились маркетплейсы MCP.
  • Проблемы:
    • Многие MCP содержат десятки тулов → быстро съедается контекст (>100 функций = хаос).
    • Безопасность: если сервер подгружается по сети, поведение агента может неожиданно измениться.
  • Автор не хейтит MCP — проблемы во многом уже решены, MCP имеет право на жизнь.

Skills (2025 →) — главная тема доклада

Скилл = директория + джентльменское соглашение.

Состав:

  • SKILL.md — как работает этот скилл
  • Инструменты (bash-скрипты, Python-код) в той же директории
  • (новое предложение автора) — данные прямо в этой же директории

Ключевое преимущество: двухэтапная загрузка описания скилла

Что Что видно всегда Что подгружается по требованию
Короткое описание Попадает в System Prompt агента → он знает, что скилл существует
Длинное описание Только когда агент решил «мне нужен этот скилл» — он заходит в директорию и читает SKILL.md

Это позволяет иметь очень много скиллов без переполнения контекста. Пример: Hermes у автора начинался с 56 скиллов, через пару недель работы вырос до 100 — и всё равно работает. С тулами такое невозможно (2 запроса — и контекст закончился).

Стоимость создания:

  • MCP-сервер: нужен разработчик.
  • Скилл: нужно уметь писать тексты (можно даже не на английском). Распространение — через мессенджер / GitHub / куда угодно.

Skills vs MCP — когда что использовать

Ситуация Что выбрать
Не знаешь, какие задачи будет решать агент Skills
Задачи разнообразные, разные тулы для разных сценариев Skills
Количество тулов 550 Skills
Агент узкоспециализированный, задачи однотипные MCP
Для каждой задачи нужен один и тот же набор тулов MCP
Мало тулов и агент решает однотипный поток задач MCP

Оговорка: грань стирается. Например, Claude Code использует MCP не напрямую, а превращает их в скиллы (файлик подкладывается, функции сразу в контекст не попадают). В этом режиме минусы MCP во многом исчезают.

Что автор считает «недостающим» в классическом скилле

Как «архитектура фон Неймана без данных»: код есть, а данных нет. Предложение — добавлять в скилл данные и историю использования прямо внутри git-репозитория.

Тогда скилл раскрывается как:

  • короткое описание
  • длинное описание
  • инструменты
  • + данные

Часть 4. Skill-first архитектура на базе git

Почему именно git

Git-репозиторий как контейнер скилла + данных даёт:

  1. Skill-first архитектура: к одному скиллу можно подключить несколько разных агентов (Claude Code для больших операций, Hermes через Telegram для быстрых, OpenClaude — из любой точки).
  2. Встраивание в CI/CD: пайплайн работает с тем же git-репозиторием.
  3. Совместная работа команды: можно делиться скиллом с коллегами.
  4. Решение проблемы коллизий: современные модели на харнессах научились решать merge-конфликты. Раньше нужен был человек — сейчас нет. Это позволяет строить системы с параллельной работой многих акторов на голом git, без транзакционной БД. (Не для платежей, конечно, но для многого — да.)

Обязательные правила в AGENTS.md для такого скилла

  • Всегда git pull в начале работы (последние данные).
  • Сразу push + commit после работы (не терять правки).
  • CI как «back-pressure» (обратное давление) — обязательно прописать в AGENTS.md. Возвращает агента в рамки, если он начинает «расползаться» — придумывать себе новые задачи, отклоняться от того, что описано в AgentsMD. Без CI изменения накапливаются, агент уходит в свою сторону.

Часть 5. Личные скиллы автора (ежедневное использование)

Список скиллов

Скилл Что делает Особенность
ДНК / медицина Анализ ДНК-тестов и секвенирования всей семьи Разбирается ниже
Рекомендации Фильмы, музыка, игры Основан на выгрузке ~1000 оценок с КиноНавигатора
Планирование поездок Командировки, документы, брони Разбирается ниже
HR / оценка резюме Автоматическая оценка присланных резюме Разбирается ниже
Управление финансами Мониторинг платежей, показания счётчиков, долги
R&D по агентам (командный) Исследование агентов, много людей одновременно

Скилл 1. ДНК и медицина

Данные:

  • ДНК-тесты (Atlas, Genotek) на всех членов семьи
  • ДНК-секвенирование — ~100 ГБ прочитанного ДНК
  • По каждому человеку — шаблон: пол, возраст, вес, лекарства, особенности

Возможности:

  • Задавать вопросы про себя: какие лекарства эффективнее, какие виды спорта подходят, стиль обучения
  • Сравнивать двух людей — кто более общительный, кто усидчивый (звучит как слоп, но работает)
  • Автоматическая сборка сырого ДНК в единую цепочку (у автора это заняло неделю руками — Claude сделал за сутки)
  • Скачивание референсного генома и сравнение
  • Дашборд в стиле компьютерной игры: перки, дебафы, распределение характеристик

Впечатляющий сценарий: У каждого человека ~100 уникальных мутаций (из них 10 полезных, 10 вредных, 80 нейтральных в среднем). Большинство науке неизвестны.

  • Автор попросил Claude проанализировать конкретную мутацию.
  • Claude нашёл, что мутация не описана нигде.
  • Определил, к какому гену относится.
  • Сам обратился к AlphaFold (Google) — ИИ для рендеринга сворачивания белков.
  • Отрендерил белок автора и сделал вывод: белок сворачивается корректно, мутация ничего не значит.

Валидация:

  • Автор сравнил разные ДНК-тесты одного человека (Atlas / Genotek / секвенирование) → совпадение 99.95%. Лаборатории не жульничают.

Контекст (важные истории «AI в медицине»):

  • Reddit-пользователь через ChatGPT + MRI-снимок нашёл сложную взаимосвязь болей в спине с дефицитом B12. Пошёл к врачу — подтвердилось. История опубликована в блоге OpenAI.
  • Пол Конингемего собака заболела раком. Он с помощью ChatGPT + AlphaFold сам разработал индивидуальную мРНК-вакцину, заказал печать в лаборатории, вколол собаке. Собака была вылечена.

Масштаб:

  • Референсный геном человека: 3 млрд долларов, 13 лет работы.
  • Свой полный геном сегодня: ~1000 долларов и один вечер работы ноутбука + Claude.

«Домашняя работа над исходниками себя» — то, что раньше было доступно только большой науке.

Скилл 2. Планирование поездок

Структура скилла:

  • Шаблон командировки
  • Список людей, которые могут поехать (со всеми документами)

Сценарий:

  1. Открыл Cursor → «создай мне поездку в Китай»
  2. Ушёл, поехал домой
  3. В Telegram (через Hermes или OpenClaude, подключённый к тому же скиллу) — фотография купленного билета
  4. Агент делает git pull, добавляет билет в структуру поездки, кладёт PDF в директорию поездки, коммитит
  5. В любой момент можно спросить: «что осталось по поездке?» — он ответит: «не забронирована гостиница, между самолётами 2 часа — даже не пытайся»

Автозаполнение — успешно заполнил заявление на визу практически без ошибок.

Скилл 3. HR / оценка резюме

Как возник: стихийно. Автор кинул Hermes'у резюме (картинка без текстового слоя), сказал «оцени».

  • Hermes подтянул OCR
  • Первая оценка была нерелевантной
  • Автор давал фидбэк на каждой итерации:
    • «человек ищет только удалёнку, а у нас гибрид — таких не рассматриваем»
    • «когда у человека есть GitHub, обязательно заходи, анализируй код, оценивай impact в open source»
  • 1020 итераций — скилл сам себя корректировал

Результат: «идеальный HR-скилл». Кидаешь резюме → получаешь ответ → соглашаешься, если смотришь глазами. Ошибок ~10%.

Правовая оговорка: резюме приходят напрямую в личку → есть моральное право на обработку. Закон о персональных данных соблюдён.


Часть 6. Автоулучшение скиллов (пример Hermes)

Hermes построен полностью вокруг скиллов — не только использует, но и создаёт их автономно.

Критерий автосоздания скилла

Если Hermes на какую-то задачу потратил >5 tool calls, он сразу рассматривает: «а не стоит ли это запомнить как скилл».

Механизм куратора (два слоя)

  1. Прунинг (обрезание неиспользуемого)

    • Скилл не использовался 30 дней → он делается неактивным (в системе есть, но его description не подкладывается или подкладывается уменьшенным).
    • Скилл не использовался 90 дней → архивируется, полностью исчезает из системы.
  2. Консолидация (раз в 7 дней)

    • Анализирует, можно ли попарно объединить мелкие скиллы в более крупный.
    • Не даёт системе раздуться до тысяч скиллов, чьи «короткие описания» съедят весь контекст.

Итог

Скиллы эволюционируют автоматически. Если они ещё и с данными — они становятся основой системы и новой памятью агента.

Раньше память делали на:

  • поиск в переписках
  • RAG на извлечении фактов о пользователе

Теперь вся информация о пользователе лежит в скиллах, подгружается ровно тогда, когда скилл активирован, и харнесс сам решает, что попадёт в контекст (а не RAG «за него» до начала работы модели).


Часть 7. Агентные циклы (три уровня)

Это следующая большая тема после харнессов. По прогнозу автора — «стрельнёт» в 2027.

Уровень 1: Inner Loop (React-цикл внутри харнесса)

Задача → вызов тулов → ... → решено → текстовый ответ. Классика.

Уровень 2: Outer Loop / Ralph Loop (придумал Джеффри Хантли)

Харнесс засунут в бесконечный while true:

while true; do
  claude --dangerously-skip-permissions -p "реши задачу" || true
done

Позволяет агенту работать днями/неделями. Хитрости против «слопа»:

  • Back-pressure через CI/CD — если агент слетает с катушек, CI возвращает его
  • Валидация качества кода

Почему это работает:

  • Позволяет работать без раста контекста.
  • Когда контекст растёт → в какой-то момент кончается → суммаризация → потеря данных → агент тупеет (кто пользовался OpenClaude — «сегодня решил задачу, завтра ту же задачу забыл»).
  • У модели есть смарт-зона — примерно первая треть контекста, где она максимально «умная». Дальше — глупеет, даже если у неё миллионный контекст.
  • Ralph Loop позволяет постоянно оставаться в смарт-зоне.

Уровень 3: Meta Loop (авторский, не общепринятый)

Проблема, подсвеченная Андреем Карпатымсхлопывание (collapse). Если давать модели одну и ту же задачу постоянно, она «решает разными способами», но фактически всеми одним и тем же способом с разными словами.

Пример Карпатого: попросите модель рассказать анекдот, потом ещё один, потом ещё. На пятый раз — тот же анекдот, только место действия и герои другие.

Решение (авторское Meta Loop):

  • В какой-то момент полностью останавливаем цикл
  • Полностью зачищаем все данные, которые агент создал
  • Данные складываем в архив, который агент изначально не видит
  • Запускаем цикл с чистого листа → агент идёт другим путём
  • Через какое-то время он находит архив, распаковывает, обнаруживает свои прошлые данные → но уже пошёл в другую сторону
  • Это позволяет исследовать задачу в разных направлениях

Хорошо для исследовательских задач, когда сам до конца не понимаешь, что решаешь.

Пример Ralph Loop в коде

while true; do
  claude "реши задачу"   # inner loop внутри
done                     # outer loop = Ralph
# meta loop уже не в коде

Часть 8. Q&A — важные тезисы

Про фундаментальность скиллов

  • Ничего фундаментального в LLM-движухе нет.
  • Полгода — и всё меняется.
  • Корпорации страдают: «утвердили MCP на архкоме → все хотят A2A → утвердили A2A → снова поменялось».

Кого автор нанимает

  • Команда R&D, поэтому смотрит на:
    • Широкий технический кругозор
    • Автономность — full-stack, сам может найти задачу, прикопать, решить
  • Знания по агентам «доберёт в процессе».
  • Круто, если есть фундаментальная математика и понимание устройства обучения, но не стоп-фактор.

Какие данные класть в скилл (нет стандартов)

  • Пока — только интуиция и статистика использования.
  • Автор в геномный скилл кладёт 200 ГБ данных, в скилл поездок — 100 КБ. Оба работают одинаково хорошо.
  • «Потолок сверху ещё не нащупал.» Харнессы умные — насыщение данными скилл не убивает (в отличие от RAG и классических промптов).

Что ещё можно добавить в архитектуру агента (вопрос из зала)

  • Слушатель предложил концепцию: LLM → tools → skills → auto-improvement → «больше ничего добавить нельзя?»
  • Автор: не хватает восприятия мира / квалиа.
  • Пример: «до автомойки 5 минут ехать или 10 минут идти пешком — как лучше?» Нейронка отвечает: «Пешочком сходите, всего 5 минут». Не понимает, что без машины на автомойке делать нечего.
  • Возможно помогут world-models (модели мира), но как их сделать — открытый вопрос.

Прикладной пример: авто-улучшение агента

Автор построил скилл, где:

  • Данные: бенчмарк, который надо улучшить + код агента
  • Задача агенту: улучшай себя на бенчмарке в цикле
  • Идея взята у Карпатого (репозиторий назывался «autoagent»):
    • Агент выдвигает гипотезу
    • Меряет бенчмарк
    • Хорошая гипотеза → фиксирует
    • Плохая → откатывает
  • Стартовая база: слабый ГигаЧат, решал 1 из 89 задач бенча
  • Результат за выходные: 11 задач из 89
  • Рост в 11 раз.
  • Автор проверил всё — «сделал адекватно, нигде не заоверфитился».

Сквозные принципы доклада

  1. Простота бьёт сложность. Универсальный агент с ~10 функциями работы с файлами делает больше, чем сложный мультиграф.
  2. Задачи разные — способ обработки одинаковый. Один харнесс на всё.
  3. Данные должны жить рядом с инструментами. Скилл без данных — как «фон Нейман без данных».
  4. Git — универсальный контейнер для скилла + данных + истории + коллаборации.
  5. Контекст — самый ценный ресурс. Двухэтапная загрузка скиллов, back-pressure через CI, оставаться в смарт-зоне.
  6. Автономность важнее контроля. Human-in-the-middle → man-on-the-middle → AI factory.
  7. Автоулучшение обязательно. Куратор, прунинг, консолидация, генерация новых скиллов.
  8. Циклы — новая парадигма. Inner + Outer (Ralph) + Meta.
  9. Ничего фундаментального нет. Готовьтесь переучиваться каждые полгода.

Actionable takeaways для практика

  1. Строй агентов на харнессах (Claude Code / OpenClaude / Hermes / Cursor). Это уже must-have.
  2. Не переходи с ходу на MCP — оцени: количество тулов 550 → скиллы. >50 однотипных → MCP.
  3. Клади данные в тот же git-репозиторий, где скилл. Это не убьёт агента.
  4. Прописывай в AGENTS.md жёсткие правила:
    • git pull в начале
    • push + commit в конце
    • CI как back-pressure
  5. Автоматизируй создание скиллов — если задача съела >5 tool calls, это кандидат в скилл.
  6. Внедри куратора: прунинг неиспользуемого (30/90 дней), консолидация раз в неделю.
  7. Оборачивай агента в Ralph Loop для многодневных задач: избегай раста контекста и суммаризации.
  8. Держи агента в первой трети контекста (смарт-зона), даже если у модели миллионный контекст.
  9. Для исследовательских задач — Meta Loop: периодически сноси всё в архив, стартуй с нуля.
  10. Хочешь стать HR/медиком/финансистом для себя? Начни с одного скилла с данными по своему кейсу. Итерируй фидбэком — через 1020 циклов будет работать.

Кому полезно

  • Разработчикам агентов — карта перехода от tools → MCP → skills и практическая схема хранения в git.
  • Тимлидам R&D — фреймворк оценки: скиллы vs MCP, back-pressure через CI, куратор.
  • Продактам AI-продуктов — понимание, куда движется парадигма (skill-first архитектура, harness как бэкенд, memory-as-skills).
  • Индивидуальным biohacker'ам / self-quantifiers — реальный кейс «Claude + AlphaFold над своим ДНК за $1000 и вечер».
  • Всем, кто участвует в AI-хакатонах — 19 из 20 победителей уже строят решения на харнессах. Догоняйте.