Files
WebinarNotes/raw/sources/Грабли во внедрении ИИ в SDLC.md
EugeneTes 3314112bb9 ingest: Stanford SWEPR widening-gap study and AI-in-SDLC adoption pitfalls
Add two new sources with summaries, new concepts (developer-as-agent-manager,
review-is-the-new-bottleneck), new entities (SWEPR, Nikolai Sheiko), and a
query on the Stanford source; update related concept pages, overview, index,
and log.
2026-07-31 08:33:56 +02:00

17 KiB
Raw Blame History

Выводы по видео

Источник: https://www.youtube.com/watch?v=Nm3MsnngCJg Название: Грабли во внедрении ИИ в SDLC — почему ИИ есть, а результата нет и как это лечить (Николай Шейко) Длительность: 45:59


Главный тезис

ИИ в разработке уже даёт реальный прирост, но люди, компании и метрики тормозят его на порядок. С декабря 2025 (Opus 4.5 / GPT-5.2 + Claude Code / Codex) начался настоящий скачок — SDLC схлопнулся в дни/часы. Но результат появляется только у тех, кто (а) перестал быть просто разработчиком и стал менеджером агента, (б) построил feedback loop, (в) меряет выполненные задачи без rework, а не строки кода / PR-ы, и (г) занимается эволюцией системы (skill-и, промпты, инструменты), а не одноразовыми настройками.

Ключевая цитата: «Компаниям больше не нужна кастомная AI-разработка. Им нужно прийти, поставить Claude Code или Codex, всё настроить, прицепить коннекторы, подумать про безопасность — и это работает лучше любой кастомной».


1. Прошлое: что уже произошло

Событие Что важно
Статья METR (июль 25) Ожидали ускорение, а замер показал замедление. Но у исследования много методологических проблем
Стэнфордское исследование (август 25) +20% скорости, но разрыв между топ-перформерами и середняками растёт — догнать всё сложнее
Твит Карпаты (ноябрь-декабрь 25) Автор термина «vibe-coding» сам говорит: раньше было баловство, теперь 80% делает Claude Code, 20% дорабатываю руками
Статья «SDLC is dead» Стадии жизненного цикла схлопнулись из недель в дни/часы

Но SDLC схлопнулся не полностью. Осталось два «красных квадратика» — люди:

  • Ревьюер — узкое место. Задачи копятся в очереди на ревью.
  • Планировщик / продукт — тоже человек.

Распределение времени разработчика сдвинулось с «кодинга посередине» к «планированию слева + проверке справа».


2. Универсальная ошибка №0: разработчик ≠ менеджер

  • Хороший разработчик = 3-5 часов сфокусированной работы над одной фичей (CPU-bound).
  • Хороший AI-разработчик = менеджер сотрудника-агента (IO-bound), запускающий несколько задач параллельно.
  • Если ты запустил Claude Code и сидишь смотришь, как он работает — ты плохой сотрудник.
  • Не все психологически способны переключиться. И это нормально — не заставляйте всех.

3. Кейсы и ошибки

Кейс 1: Перенос фронтенда на новый стек

Ошибка Лечение
Нет feedback loop у агента Дать доступ к браузеру (Playwright / Agent Browser / Chrome DevTools) — пусть сравнивает старый vs новый фронт
Кранч → баги, плохая архитектура, порочный круг фиксов Много времени на планирование. 20 минут — минимум, часы — норма. Каждые 10 минут планирования экономят часы. Цель — реализация за один шаг
Устаревшие инструменты (Cursor + оплата за токены → команда экономит) Claude Code / Codex по подпискам
Внешний эксперт настраивает — «магический артефакт» Люди должны настраивать инструменты сами. Опросник, чтобы вытащить неявные знания в инструкцию агента
Всех под одну гребёнку тащить в AI Разное сопротивление — нормально. Консерваторы охраняют компанию от вайб-кодеров
Взяли архитектурный проект для обучения Архитектурные ошибки стоят дорого и живут годами. Лучше начинать не с архитектуры

Решение по обучению команды: записать видео → скрипт для выгрузки всех сессий → эксперт отсматривает → пишет фидбэк команде, а команда сама правит инструкции агента → фокус на 2 топ-перформерах (час с ними даёт 10× больше пользы, чем с остальными).

Кейс 2: Европейский аутсорс — PR-ов больше, а прирост +1%

Причина — rework. Быстро задеплоили, потом много доработок.

Ошибки метрик (мем всех компаний):

Не мерить Мерить
Строки кода Количество выполненных задач в единицу времени
Количество коммитов (задача выполнена только если не вернулась на доработку)
Число PR-ов Время жизни задачи + время на доработки

Ревью — новое узкое место. Ручное ревью → скапливаются задачи → выгорание → снижение качества. Решение — ревью вместе с агентом (не вместо, а вместе). Модель = умный студент: направляйте, задавайте гипотезы, находите проблемы.

Кейс 3: Большая кодовая база + «проклятие compaction»

  • Агент собирает контекст → окно переполняется → compaction → снова добирает → снова compaction → задача еле выполняется.
  • Компания решила: «раз агенты, best practices не нужны». Ошибка.
  • Best practices нужны именно для агента: локальность, изолированные модули с интерфейсами, кодовая база хранит контекст.
  • AST Search вместо grep на колоссальных проектах — grep выдаёт «портянку» мусора, AST даёт релевантное. Работает на разных языках.

Мини-кейсы

  • Middle, который внедрил AI и ускорил команду на десятки %, попросил повышение зарплаты, не получил — ушёл на сильно больше. Если вы такой middle — задумайтесь. Если руководитель — вдвойне.
  • Стартап, который делает spec-driven development, не зная, что хочет. Планирование бесполезно, если нет цели. Сначала соберите UI (даже с in-memory базой в браузере) → покликайте → поймите, что нужно → потом планируйте.

4. Что будет дальше (будущее ролей)

Появление Product-инженера

Планирование съедает больше времени → нужен человек, который отвечает не «как технически сделать», а «почему технически делаем так, чем можем пренебречь, что упростить, на что забить».

Intelligence vs Judgment

  • Intelligence (последовательности действий, требующие интеллекта) — AI уже отжирает.
  • Judgment (вкус, различие полутонов, доменная экспертиза) — пока за людьми.
  • Мы детектим slop в интернете, потому что там нет human touch.
  • Judgment = либо вкус, наработанный годами (хороший код), либо доменная экспертиза (нефтянка, медицина).

Разделение ролей: пользователь vs настройщик системы

Сейчас те, кто пишет код с AI, и те, кто настраивает harness — обычно одни люди. Постепенно разделяется:

  • Пользователи — планирование + верификация конкретной фичи.
  • Agentic Operations — настраивают SDLC, feedback loop-ы, инструменты, промпты, скиллы.

Тренды на токены

  • Пока дорожают — в ближайшее время. Позже, вероятно, начнут дешеветь.
  • Сейчас — дикий запад. Задача — оказаться в верхней половине графика Стэнфорда.
  • Экспериментируйте на полную котлету, пока подписки дешёвые.

5. Agentic Evolution — ключевой концепт

Как правильно обучать агента:

Плохо Хорошо
Спросить эксперта «как ты это делаешь» → он расскажет теорию Взять нового сотрудника (агента) за ручку → провести по сложным задачам → показать грабли → потом сказать: «Запомни всё это и напиши методичку следующему»

Без этого мы пользуемся тем, что нам дали по умолчанию. С этим — начинается вертикальный рост.

Как верифицировать скилл:

  1. Написал скилл вместе с агентом.
  2. Не иди обедать.
  3. Запусти сабагента без контекста → пусть решит ту же задачу с нуля, используя только скилл.
  4. Основной агент смотрит, что не так → правит скилл.
  5. Так агент-ментор онбордит следующего агента.

6. Матрица «что делать / чего не делать»

Ошибки разработчика

  • Ревью полностью вручную
  • Отдать ревью целиком агенту
  • Слишком мало времени на планирование
  • Слишком много планирования при неясной цели
  • Обмазываться сабагентами / мультиагентными системами сразу (сложные системы вырастают из простых)
  • Забить на эволюцию (жить с дефолтами)

Ошибки компании

  • Нанять внешнего настройщика (даст рыбу, но не удочку) → нужен препод/куратор
  • Устаревшие инструменты (Cursor с оплатой за токены)
  • Всех сотрудников под одну гребёнку в AI
  • Не повышать зарплату — потеряете тех, кто разобрался
  • Надеяться на быстрый результат — это долгий навык
  • Нанимать по-старому
  • Метрики, которые легко хакаются (LoC, PR count)

7. Что можно сделать завтра

  1. Замкните feedback loop, если ещё нет.
  2. Напишите скилл, который анализирует ваши сессии хотя бы за день.
  3. Автоматизируйте: schedule в Codex или routines в Anthropic.
  4. Голосовой ввод (сильно больше контекста), причём на русском — тоже больше контекста, чем на английском.
  5. Не гоняйтесь за каждым новым инструментом — что не всасывается в Claude Code / Codex за пару месяцев, скорее всего бесполезно.

8. Долгосрочный план

  • Стать «правым» на слайде — тем, кто настраивает систему, а не пользуется.
  • Вкатываться, пока подписки дешёвые.
  • Отлаживать систему до one-shot execution (реализация за один проход, не итерации).
  • Автоматический анализ сессий на уровне команды — искать общие паттерны, не только личные.

9. Из Q&A: заметки на полях

  • Embeddings в AI-инжиниринге / RAG поверх эмбеддингов кодане работает. Не используйте, если не понимаете очень хорошо, зачем.
  • Cursor не тот инструмент, потому что: (а) отставал от Claude Code, (б) тащит старые фичи (embedding-индекс), (в) поддержка совместимости с VS Code съедает ресурсы, (г) оплата за токены → команда экономит вместо экспериментов. ~30% дороже подписок при том же уровне.
  • Дефицит железа: H100/H600 не арендовать. Claude банит через раз, требует верификацию email. Прогноз докладчика: AI назовут кибероружием, введут лицензии как на биотех/фарму.
  • Китайские модели — важный тренд:
    • GLM (ZAI) — «красавчики», хорошая модель, есть свой GUI-клон Codex, подключается любая модель. Минус — не vision.
    • Kimi — рабочая, есть vision (для frontend feedback loop).
    • Xiaomi агент — интересная реализация памяти (стоит посмотреть). Head of AI перешёл туда из DeepSeek.
  • Как заставить агента справиться за один шаг:
    1. Feedback loop — must have.
    2. Новая фича goal — чётко формулируйте реальную цель; агент сам проверяет, достигнута ли.
    3. Скилл-верификация через субагента без контекста.

10. Кому это полезно

  • Тимлидам и техлидам, которые внедряют AI и меряют строками кода (перестаньте).
  • Разработчикам, которые сидят и смотрят, как Claude работает — пора становиться менеджером.
  • CTO — не нанимайте внешнего настройщика, наймите куратора; повышайте зарплату тем, кто разобрался, иначе уйдут.
  • Стартаперам — не делайте spec-driven, пока не знаете, что хотите.
  • AI-инженерам — не суйте embeddings в код, стройте skill evolution через субагента без контекста.
  • Всем — замкните feedback loop и включите голосовой ввод на русском завтра.