Add two new sources with summaries, new concepts (developer-as-agent-manager, review-is-the-new-bottleneck), new entities (SWEPR, Nikolai Sheiko), and a query on the Stanford source; update related concept pages, overview, index, and log.
17 KiB
Выводы по видео
Источник: https://www.youtube.com/watch?v=Nm3MsnngCJg Название: Грабли во внедрении ИИ в SDLC — почему ИИ есть, а результата нет и как это лечить (Николай Шейко) Длительность: 45:59
Главный тезис
ИИ в разработке уже даёт реальный прирост, но люди, компании и метрики тормозят его на порядок. С декабря 2025 (Opus 4.5 / GPT-5.2 + Claude Code / Codex) начался настоящий скачок — SDLC схлопнулся в дни/часы. Но результат появляется только у тех, кто (а) перестал быть просто разработчиком и стал менеджером агента, (б) построил feedback loop, (в) меряет выполненные задачи без rework, а не строки кода / PR-ы, и (г) занимается эволюцией системы (skill-и, промпты, инструменты), а не одноразовыми настройками.
Ключевая цитата: «Компаниям больше не нужна кастомная AI-разработка. Им нужно прийти, поставить Claude Code или Codex, всё настроить, прицепить коннекторы, подумать про безопасность — и это работает лучше любой кастомной».
1. Прошлое: что уже произошло
| Событие | Что важно |
|---|---|
| Статья METR (июль 25) | Ожидали ускорение, а замер показал замедление. Но у исследования много методологических проблем |
| Стэнфордское исследование (август 25) | +20% скорости, но разрыв между топ-перформерами и середняками растёт — догнать всё сложнее |
| Твит Карпаты (ноябрь-декабрь 25) | Автор термина «vibe-coding» сам говорит: раньше было баловство, теперь 80% делает Claude Code, 20% дорабатываю руками |
| Статья «SDLC is dead» | Стадии жизненного цикла схлопнулись из недель в дни/часы |
Но SDLC схлопнулся не полностью. Осталось два «красных квадратика» — люди:
- Ревьюер — узкое место. Задачи копятся в очереди на ревью.
- Планировщик / продукт — тоже человек.
Распределение времени разработчика сдвинулось с «кодинга посередине» к «планированию слева + проверке справа».
2. Универсальная ошибка №0: разработчик ≠ менеджер
- Хороший разработчик = 3-5 часов сфокусированной работы над одной фичей (CPU-bound).
- Хороший AI-разработчик = менеджер сотрудника-агента (IO-bound), запускающий несколько задач параллельно.
- Если ты запустил Claude Code и сидишь смотришь, как он работает — ты плохой сотрудник.
- Не все психологически способны переключиться. И это нормально — не заставляйте всех.
3. Кейсы и ошибки
Кейс 1: Перенос фронтенда на новый стек
| Ошибка | Лечение |
|---|---|
| Нет feedback loop у агента | Дать доступ к браузеру (Playwright / Agent Browser / Chrome DevTools) — пусть сравнивает старый vs новый фронт |
| Кранч → баги, плохая архитектура, порочный круг фиксов | Много времени на планирование. 20 минут — минимум, часы — норма. Каждые 10 минут планирования экономят часы. Цель — реализация за один шаг |
| Устаревшие инструменты (Cursor + оплата за токены → команда экономит) | Claude Code / Codex по подпискам |
| Внешний эксперт настраивает — «магический артефакт» | Люди должны настраивать инструменты сами. Опросник, чтобы вытащить неявные знания в инструкцию агента |
| Всех под одну гребёнку тащить в AI | Разное сопротивление — нормально. Консерваторы охраняют компанию от вайб-кодеров |
| Взяли архитектурный проект для обучения | Архитектурные ошибки стоят дорого и живут годами. Лучше начинать не с архитектуры |
Решение по обучению команды: записать видео → скрипт для выгрузки всех сессий → эксперт отсматривает → пишет фидбэк команде, а команда сама правит инструкции агента → фокус на 2 топ-перформерах (час с ними даёт 10× больше пользы, чем с остальными).
Кейс 2: Европейский аутсорс — PR-ов больше, а прирост +1%
Причина — rework. Быстро задеплоили, потом много доработок.
Ошибки метрик (мем всех компаний):
| Не мерить | Мерить |
|---|---|
| Строки кода | Количество выполненных задач в единицу времени |
| Количество коммитов | (задача выполнена только если не вернулась на доработку) |
| Число PR-ов | Время жизни задачи + время на доработки |
Ревью — новое узкое место. Ручное ревью → скапливаются задачи → выгорание → снижение качества. Решение — ревью вместе с агентом (не вместо, а вместе). Модель = умный студент: направляйте, задавайте гипотезы, находите проблемы.
Кейс 3: Большая кодовая база + «проклятие compaction»
- Агент собирает контекст → окно переполняется → compaction → снова добирает → снова compaction → задача еле выполняется.
- Компания решила: «раз агенты, best practices не нужны». Ошибка.
- Best practices нужны именно для агента: локальность, изолированные модули с интерфейсами, кодовая база хранит контекст.
- AST Search вместо grep на колоссальных проектах — grep выдаёт «портянку» мусора, AST даёт релевантное. Работает на разных языках.
Мини-кейсы
- Middle, который внедрил AI и ускорил команду на десятки %, попросил повышение зарплаты, не получил — ушёл на сильно больше. Если вы такой middle — задумайтесь. Если руководитель — вдвойне.
- Стартап, который делает spec-driven development, не зная, что хочет. Планирование бесполезно, если нет цели. Сначала соберите UI (даже с in-memory базой в браузере) → покликайте → поймите, что нужно → потом планируйте.
4. Что будет дальше (будущее ролей)
Появление Product-инженера
Планирование съедает больше времени → нужен человек, который отвечает не «как технически сделать», а «почему технически делаем так, чем можем пренебречь, что упростить, на что забить».
Intelligence vs Judgment
- Intelligence (последовательности действий, требующие интеллекта) — AI уже отжирает.
- Judgment (вкус, различие полутонов, доменная экспертиза) — пока за людьми.
- Мы детектим slop в интернете, потому что там нет human touch.
- Judgment = либо вкус, наработанный годами (хороший код), либо доменная экспертиза (нефтянка, медицина).
Разделение ролей: пользователь vs настройщик системы
Сейчас те, кто пишет код с AI, и те, кто настраивает harness — обычно одни люди. Постепенно разделяется:
- Пользователи — планирование + верификация конкретной фичи.
- Agentic Operations — настраивают SDLC, feedback loop-ы, инструменты, промпты, скиллы.
Тренды на токены
- Пока дорожают — в ближайшее время. Позже, вероятно, начнут дешеветь.
- Сейчас — дикий запад. Задача — оказаться в верхней половине графика Стэнфорда.
- Экспериментируйте на полную котлету, пока подписки дешёвые.
5. Agentic Evolution — ключевой концепт
Как правильно обучать агента:
| Плохо | Хорошо |
|---|---|
| Спросить эксперта «как ты это делаешь» → он расскажет теорию | Взять нового сотрудника (агента) за ручку → провести по сложным задачам → показать грабли → потом сказать: «Запомни всё это и напиши методичку следующему» |
Без этого мы пользуемся тем, что нам дали по умолчанию. С этим — начинается вертикальный рост.
Как верифицировать скилл:
- Написал скилл вместе с агентом.
- Не иди обедать.
- Запусти сабагента без контекста → пусть решит ту же задачу с нуля, используя только скилл.
- Основной агент смотрит, что не так → правит скилл.
- Так агент-ментор онбордит следующего агента.
6. Матрица «что делать / чего не делать»
Ошибки разработчика
- Ревью полностью вручную ❌
- Отдать ревью целиком агенту ❌
- Слишком мало времени на планирование ❌
- Слишком много планирования при неясной цели ❌
- Обмазываться сабагентами / мультиагентными системами сразу ❌ (сложные системы вырастают из простых)
- Забить на эволюцию (жить с дефолтами) ❌
Ошибки компании
- Нанять внешнего настройщика (даст рыбу, но не удочку) → нужен препод/куратор
- Устаревшие инструменты (Cursor с оплатой за токены)
- Всех сотрудников под одну гребёнку в AI
- Не повышать зарплату — потеряете тех, кто разобрался
- Надеяться на быстрый результат — это долгий навык
- Нанимать по-старому
- Метрики, которые легко хакаются (LoC, PR count)
7. Что можно сделать завтра
- Замкните feedback loop, если ещё нет.
- Напишите скилл, который анализирует ваши сессии хотя бы за день.
- Автоматизируйте: schedule в Codex или routines в Anthropic.
- Голосовой ввод (сильно больше контекста), причём на русском — тоже больше контекста, чем на английском.
- Не гоняйтесь за каждым новым инструментом — что не всасывается в Claude Code / Codex за пару месяцев, скорее всего бесполезно.
8. Долгосрочный план
- Стать «правым» на слайде — тем, кто настраивает систему, а не пользуется.
- Вкатываться, пока подписки дешёвые.
- Отлаживать систему до one-shot execution (реализация за один проход, не итерации).
- Автоматический анализ сессий на уровне команды — искать общие паттерны, не только личные.
9. Из Q&A: заметки на полях
- Embeddings в AI-инжиниринге / RAG поверх эмбеддингов кода — не работает. Не используйте, если не понимаете очень хорошо, зачем.
- Cursor не тот инструмент, потому что: (а) отставал от Claude Code, (б) тащит старые фичи (embedding-индекс), (в) поддержка совместимости с VS Code съедает ресурсы, (г) оплата за токены → команда экономит вместо экспериментов. ~30% дороже подписок при том же уровне.
- Дефицит железа: H100/H600 не арендовать. Claude банит через раз, требует верификацию email. Прогноз докладчика: AI назовут кибероружием, введут лицензии как на биотех/фарму.
- Китайские модели — важный тренд:
- GLM (ZAI) — «красавчики», хорошая модель, есть свой GUI-клон Codex, подключается любая модель. Минус — не vision.
- Kimi — рабочая, есть vision (для frontend feedback loop).
- Xiaomi агент — интересная реализация памяти (стоит посмотреть). Head of AI перешёл туда из DeepSeek.
- Как заставить агента справиться за один шаг:
- Feedback loop — must have.
- Новая фича goal — чётко формулируйте реальную цель; агент сам проверяет, достигнута ли.
- Скилл-верификация через субагента без контекста.
10. Кому это полезно
- Тимлидам и техлидам, которые внедряют AI и меряют строками кода (перестаньте).
- Разработчикам, которые сидят и смотрят, как Claude работает — пора становиться менеджером.
- CTO — не нанимайте внешнего настройщика, наймите куратора; повышайте зарплату тем, кто разобрался, иначе уйдут.
- Стартаперам — не делайте spec-driven, пока не знаете, что хотите.
- AI-инженерам — не суйте embeddings в код, стройте skill evolution через субагента без контекста.
- Всем — замкните feedback loop и включите голосовой ввод на русском завтра.