Add two new sources with summaries, new concepts (developer-as-agent-manager, review-is-the-new-bottleneck), new entities (SWEPR, Nikolai Sheiko), and a query on the Stanford source; update related concept pages, overview, index, and log.
199 lines
17 KiB
Markdown
199 lines
17 KiB
Markdown
# Выводы по видео
|
||
|
||
**Источник:** https://www.youtube.com/watch?v=Nm3MsnngCJg
|
||
**Название:** Грабли во внедрении ИИ в SDLC — почему ИИ есть, а результата нет и как это лечить (Николай Шейко)
|
||
**Длительность:** 45:59
|
||
|
||
---
|
||
|
||
## Главный тезис
|
||
|
||
**ИИ в разработке уже даёт реальный прирост, но люди, компании и метрики тормозят его на порядок.** С декабря 2025 (Opus 4.5 / GPT-5.2 + Claude Code / Codex) начался настоящий скачок — SDLC схлопнулся в дни/часы. Но результат появляется только у тех, кто (а) перестал быть просто разработчиком и стал менеджером агента, (б) построил feedback loop, (в) меряет **выполненные задачи без rework**, а не строки кода / PR-ы, и (г) занимается **эволюцией системы** (skill-и, промпты, инструменты), а не одноразовыми настройками.
|
||
|
||
Ключевая цитата: *«Компаниям больше не нужна кастомная AI-разработка. Им нужно прийти, поставить Claude Code или Codex, всё настроить, прицепить коннекторы, подумать про безопасность — и это работает лучше любой кастомной».*
|
||
|
||
---
|
||
|
||
## 1. Прошлое: что уже произошло
|
||
|
||
| Событие | Что важно |
|
||
|---|---|
|
||
| Статья METR (июль 25) | Ожидали ускорение, а замер показал замедление. Но у исследования много методологических проблем |
|
||
| Стэнфордское исследование (август 25) | +20% скорости, но **разрыв между топ-перформерами и середняками растёт** — догнать всё сложнее |
|
||
| Твит Карпаты (ноябрь-декабрь 25) | Автор термина «vibe-coding» сам говорит: раньше было баловство, теперь 80% делает Claude Code, 20% дорабатываю руками |
|
||
| Статья «SDLC is dead» | Стадии жизненного цикла схлопнулись из недель в дни/часы |
|
||
|
||
**Но SDLC схлопнулся не полностью.** Осталось два «красных квадратика» — люди:
|
||
- **Ревьюер** — узкое место. Задачи копятся в очереди на ревью.
|
||
- **Планировщик / продукт** — тоже человек.
|
||
|
||
Распределение времени разработчика сдвинулось с «кодинга посередине» к «планированию слева + проверке справа».
|
||
|
||
---
|
||
|
||
## 2. Универсальная ошибка №0: разработчик ≠ менеджер
|
||
|
||
- Хороший разработчик = 3-5 часов сфокусированной работы над одной фичей (CPU-bound).
|
||
- Хороший AI-разработчик = **менеджер сотрудника-агента** (IO-bound), запускающий несколько задач параллельно.
|
||
- Если ты запустил Claude Code и **сидишь смотришь**, как он работает — ты плохой сотрудник.
|
||
- Не все психологически способны переключиться. **И это нормально** — не заставляйте всех.
|
||
|
||
---
|
||
|
||
## 3. Кейсы и ошибки
|
||
|
||
### Кейс 1: Перенос фронтенда на новый стек
|
||
|
||
| Ошибка | Лечение |
|
||
|---|---|
|
||
| Нет feedback loop у агента | Дать доступ к браузеру (Playwright / Agent Browser / Chrome DevTools) — пусть сравнивает старый vs новый фронт |
|
||
| Кранч → баги, плохая архитектура, порочный круг фиксов | Много времени на **планирование**. 20 минут — минимум, часы — норма. Каждые 10 минут планирования экономят часы. Цель — реализация за один шаг |
|
||
| Устаревшие инструменты (Cursor + оплата за токены → команда экономит) | Claude Code / Codex по подпискам |
|
||
| Внешний эксперт настраивает — «магический артефакт» | Люди должны настраивать инструменты сами. Опросник, чтобы вытащить неявные знания в инструкцию агента |
|
||
| Всех под одну гребёнку тащить в AI | Разное сопротивление — нормально. Консерваторы охраняют компанию от вайб-кодеров |
|
||
| Взяли архитектурный проект для обучения | Архитектурные ошибки стоят дорого и живут годами. Лучше начинать не с архитектуры |
|
||
|
||
**Решение по обучению команды:** записать видео → скрипт для выгрузки всех сессий → эксперт отсматривает → **пишет фидбэк команде, а команда сама правит инструкции агента** → фокус на 2 топ-перформерах (час с ними даёт 10× больше пользы, чем с остальными).
|
||
|
||
### Кейс 2: Европейский аутсорс — PR-ов больше, а прирост +1%
|
||
|
||
Причина — **rework**. Быстро задеплоили, потом много доработок.
|
||
|
||
**Ошибки метрик** (мем всех компаний):
|
||
|
||
| Не мерить | Мерить |
|
||
|---|---|
|
||
| Строки кода | Количество **выполненных** задач в единицу времени |
|
||
| Количество коммитов | (задача выполнена только если **не вернулась** на доработку) |
|
||
| Число PR-ов | Время жизни задачи + время на доработки |
|
||
|
||
**Ревью — новое узкое место.** Ручное ревью → скапливаются задачи → выгорание → снижение качества. **Решение — ревью вместе с агентом** (не вместо, а вместе). Модель = умный студент: направляйте, задавайте гипотезы, находите проблемы.
|
||
|
||
### Кейс 3: Большая кодовая база + «проклятие compaction»
|
||
|
||
- Агент собирает контекст → окно переполняется → compaction → снова добирает → снова compaction → задача еле выполняется.
|
||
- Компания решила: «раз агенты, best practices не нужны». **Ошибка.**
|
||
- Best practices нужны именно для агента: локальность, изолированные модули с интерфейсами, кодовая база хранит контекст.
|
||
- **AST Search** вместо grep на колоссальных проектах — grep выдаёт «портянку» мусора, AST даёт релевантное. Работает на разных языках.
|
||
|
||
### Мини-кейсы
|
||
|
||
- **Middle**, который внедрил AI и ускорил команду на десятки %, попросил повышение зарплаты, не получил — ушёл на сильно больше. *Если вы такой middle — задумайтесь. Если руководитель — вдвойне.*
|
||
- **Стартап, который делает spec-driven development, не зная, что хочет.** Планирование бесполезно, если нет цели. Сначала соберите UI (даже с in-memory базой в браузере) → покликайте → поймите, что нужно → потом планируйте.
|
||
|
||
---
|
||
|
||
## 4. Что будет дальше (будущее ролей)
|
||
|
||
### Появление **Product-инженера**
|
||
|
||
Планирование съедает больше времени → нужен человек, который отвечает не «как технически сделать», а «**почему** технически делаем так, чем можем пренебречь, что упростить, на что забить».
|
||
|
||
### Intelligence vs Judgment
|
||
|
||
- **Intelligence** (последовательности действий, требующие интеллекта) — AI уже отжирает.
|
||
- **Judgment** (вкус, различие полутонов, доменная экспертиза) — пока за людьми.
|
||
- Мы детектим slop в интернете, потому что там нет human touch.
|
||
- Judgment = либо **вкус, наработанный годами** (хороший код), либо **доменная экспертиза** (нефтянка, медицина).
|
||
|
||
### Разделение ролей: пользователь vs настройщик системы
|
||
|
||
Сейчас те, кто пишет код с AI, и те, кто настраивает harness — обычно одни люди. Постепенно **разделяется**:
|
||
- **Пользователи** — планирование + верификация конкретной фичи.
|
||
- **Agentic Operations** — настраивают SDLC, feedback loop-ы, инструменты, промпты, скиллы.
|
||
|
||
### Тренды на токены
|
||
|
||
- Пока **дорожают** — в ближайшее время. Позже, вероятно, начнут дешеветь.
|
||
- Сейчас — **дикий запад**. Задача — оказаться в верхней половине графика Стэнфорда.
|
||
- **Экспериментируйте на полную котлету**, пока подписки дешёвые.
|
||
|
||
---
|
||
|
||
## 5. Agentic Evolution — ключевой концепт
|
||
|
||
Как правильно обучать агента:
|
||
|
||
| Плохо | Хорошо |
|
||
|---|---|
|
||
| Спросить эксперта «как ты это делаешь» → он расскажет теорию | Взять нового сотрудника (агента) за ручку → провести по сложным задачам → показать грабли → потом сказать: *«Запомни всё это и напиши методичку следующему»* |
|
||
|
||
Без этого мы пользуемся тем, что нам дали по умолчанию. С этим — начинается вертикальный рост.
|
||
|
||
**Как верифицировать скилл:**
|
||
|
||
1. Написал скилл вместе с агентом.
|
||
2. **Не иди обедать.**
|
||
3. Запусти сабагента **без контекста** → пусть решит ту же задачу с нуля, используя только скилл.
|
||
4. Основной агент смотрит, что не так → правит скилл.
|
||
5. Так агент-ментор онбордит следующего агента.
|
||
|
||
---
|
||
|
||
## 6. Матрица «что делать / чего не делать»
|
||
|
||
### Ошибки разработчика
|
||
|
||
- Ревью полностью вручную ❌
|
||
- Отдать ревью целиком агенту ❌
|
||
- Слишком мало времени на планирование ❌
|
||
- Слишком много планирования при неясной цели ❌
|
||
- Обмазываться сабагентами / мультиагентными системами сразу ❌ (сложные системы вырастают из простых)
|
||
- Забить на эволюцию (жить с дефолтами) ❌
|
||
|
||
### Ошибки компании
|
||
|
||
- Нанять внешнего настройщика (даст рыбу, но не удочку) → **нужен препод/куратор**
|
||
- Устаревшие инструменты (Cursor с оплатой за токены)
|
||
- Всех сотрудников под одну гребёнку в AI
|
||
- Не повышать зарплату — потеряете тех, кто разобрался
|
||
- Надеяться на быстрый результат — это долгий навык
|
||
- Нанимать по-старому
|
||
- Метрики, которые легко хакаются (LoC, PR count)
|
||
|
||
---
|
||
|
||
## 7. Что можно сделать **завтра**
|
||
|
||
1. **Замкните feedback loop**, если ещё нет.
|
||
2. **Напишите скилл, который анализирует ваши сессии** хотя бы за день.
|
||
3. **Автоматизируйте**: schedule в Codex или routines в Anthropic.
|
||
4. **Голосовой ввод** (сильно больше контекста), причём **на русском** — тоже больше контекста, чем на английском.
|
||
5. **Не гоняйтесь за каждым новым инструментом** — что не всасывается в Claude Code / Codex за пару месяцев, скорее всего бесполезно.
|
||
|
||
---
|
||
|
||
## 8. Долгосрочный план
|
||
|
||
- Стать «правым» на слайде — тем, кто настраивает систему, а не пользуется.
|
||
- Вкатываться, **пока подписки дешёвые**.
|
||
- Отлаживать систему до one-shot execution (реализация за один проход, не итерации).
|
||
- Автоматический анализ сессий на **уровне команды** — искать общие паттерны, не только личные.
|
||
|
||
---
|
||
|
||
## 9. Из Q&A: заметки на полях
|
||
|
||
- **Embeddings в AI-инжиниринге / RAG поверх эмбеддингов кода** — **не работает.** Не используйте, если не понимаете *очень* хорошо, зачем.
|
||
- **Cursor не тот инструмент**, потому что: (а) отставал от Claude Code, (б) тащит старые фичи (embedding-индекс), (в) поддержка совместимости с VS Code съедает ресурсы, (г) оплата за токены → команда экономит вместо экспериментов. ~30% дороже подписок при том же уровне.
|
||
- **Дефицит железа**: H100/H600 не арендовать. Claude банит через раз, требует верификацию email. Прогноз докладчика: **AI назовут кибероружием**, введут лицензии как на биотех/фарму.
|
||
- **Китайские модели — важный тренд:**
|
||
- **GLM** (ZAI) — «красавчики», хорошая модель, есть свой GUI-клон Codex, подключается любая модель. Минус — не vision.
|
||
- **Kimi** — рабочая, есть vision (для frontend feedback loop).
|
||
- **Xiaomi агент** — интересная реализация памяти (стоит посмотреть). Head of AI перешёл туда из DeepSeek.
|
||
- **Как заставить агента справиться за один шаг:**
|
||
1. Feedback loop — must have.
|
||
2. Новая фича **goal** — чётко формулируйте реальную цель; агент сам проверяет, достигнута ли.
|
||
3. Скилл-верификация через субагента без контекста.
|
||
|
||
---
|
||
|
||
## 10. Кому это полезно
|
||
|
||
- **Тимлидам и техлидам**, которые внедряют AI и меряют строками кода (перестаньте).
|
||
- **Разработчикам,** которые сидят и смотрят, как Claude работает — пора становиться менеджером.
|
||
- **CTO** — не нанимайте внешнего настройщика, наймите куратора; повышайте зарплату тем, кто разобрался, иначе уйдут.
|
||
- **Стартаперам** — не делайте spec-driven, пока не знаете, что хотите.
|
||
- **AI-инженерам** — не суйте embeddings в код, стройте skill evolution через субагента без контекста.
|
||
- **Всем** — замкните feedback loop и включите голосовой ввод на русском **завтра**.
|