ingest: Stanford SWEPR widening-gap study and AI-in-SDLC adoption pitfalls

Add two new sources with summaries, new concepts (developer-as-agent-manager,
review-is-the-new-bottleneck), new entities (SWEPR, Nikolai Sheiko), and a
query on the Stanford source; update related concept pages, overview, index,
and log.
This commit is contained in:
EugeneTes
2026-07-31 08:33:56 +02:00
parent 62d0f06a2d
commit 3314112bb9
24 changed files with 719 additions and 45 deletions

Binary file not shown.

After

Width:  |  Height:  |  Size: 343 KiB

View File

@@ -638,6 +638,32 @@ Your harness is unique to you.
You don't buy it. You build it — one small tool at a time.
---
And don't take my word for why this matters *now*.
Stanford measured it.
Their researchers tracked 46 teams working with AI — matched against 46 similar teams without it — for more than two years.
The teams that really learned it pulled away from the ones that just... had it.
In spring 2023, the spread between them was under five percent.
By summer 2025 — nineteen.
The gap quadrupled in two years. And the curve is still bending upward.
And remember — everyone had the same models the whole time.
The difference was never the model.
It was who built something around it.
_note: source — Stanford SWEPR, difference-in-differences analysis, Apr 2023 → Jul 2025 (see wiki/sources/2026-07-30-stanford-swepr-widening-gap.md). Honest caveats if asked in Q&A: talk-published, not yet peer-reviewed; measures software teams, not office workers; Stanford says "quality of usage" decides, without naming which practice._
---
We started this journey by pasting an email into a chat box.
We're ending it with a button that already knows what the email said.

View File

@@ -0,0 +1,60 @@
# Stanford SWEPR — AI and the widening productivity gap
_Research dossier compiled 2026-07-30. Trigger: a saved screenshot (`raw/assets/G6g3O60bkAE05ZW.png`, X/Twitter image filename) of a Stanford slide titled "Teams that master AI are accelerating their productivity gains, widening the gap with laggards." This document assembles what the underlying research says, from the slide itself plus public coverage. It is NOT a first-hand transcript of a talk; per-claim provenance is marked below._
## Who / what
- **Group:** Software Engineering Productivity Research (SWEPR), Stanford University — https://softwareengineeringproductivity.stanford.edu/
- **Lead researcher (public face):** Yegor Denisov-Blanch — https://yegordb.com/
- **Data:** private Git repositories from **600+ companies**, **~100,000120,000 software engineers**, tens of millions of commits, collected since 2022. (Coverage varies between "100k" and "120k+"; the group's own site says 120,000+.)
- **Method:** a machine-learning model trained to replicate a **panel of human expert reviewers** scoring every commit — measuring *functionality delivered* rather than commit counts or lines of code. Methodology is peer-reviewed: "Predicting Expert Evaluations in Software Code Reviews" (https://arxiv.org/pdf/2409.15152); a companion paper tests LLM determinism in code review (https://arxiv.org/pdf/2502.20747).
## The slide (primary evidence — read directly from the screenshot)
Slide 3 of a deck; footer "Stanford University / SWEPR / Software Engineering Productivity Research Group." Title: **"Teams that master AI are accelerating their productivity gains, widening the gap with laggards."**
Chart: *"Causal Impact of AI on Software Engineering Productivity: Difference-in-Differences Analysis."*
- Method steps on the slide: (1) identified **46 teams that used AI**; (2) matched with **46 similar non-AI teams**; (3) measured **net productivity gains from AI quarterly**.
- Y-axis: net productivity gain (%), causal vs the matched control group; median line + 95% CI band (Q25Q75).
- X-axis: April 2023 → July 2025, with model-release markers annotated along the top (GPT-era releases).
- **April 2023: 4.8% Q1Q3 difference. July 2025: 19% Q1Q3 difference. Labeled "Widening Gap: 4× increase."**
- Fine print: "DID Covariate Balance < 0.25".
- Early quarters (Apr 2023Jan 2024) hover around **0% or slightly negative** — the gap only opens from mid-2024 onward and then accelerates.
The slide matches Denisov-Blanch's September 2025 AI Conference talk **"Will AI Replace Software Engineers?"** (deck PDF: https://aiconference.com/wp-content/uploads/2025/09/Yegor-Denisov-Blanch-Will-AI-Replace-Software-Engineers_-.pptx.pdf). A video version of the material: "Can you prove AI ROI in Software Eng? (Stanford 120k Devs Study)" — https://www.youtube.com/watch?v=JvosMkuNxF8
## Broader findings of the study (from public coverage of the talks)
Headline: **AI coding tools deliver ~1520% net average productivity gain** — not the 10× of vendor marketing, and not zero. Gross delivered code volume rises 3040%, but **rework** (fixing AI-introduced bugs) eats roughly half the gross gain.
Gains vary sharply by context (the "it depends" matrix):
| Context | Net gain |
| --- | --- |
| Greenfield, low complexity | 3040% |
| Greenfield, high complexity | 1015% |
| Brownfield (legacy), low complexity | 1520% |
| Brownfield (legacy), high complexity | **010%, can be negative** |
- **Language popularity matters:** popular languages (Python, Java, JS/TS) ~20% on simple tasks, 1015% on complex; niche languages (COBOL, Haskell, Elixir) minimal or negative — thin AI training data.
- **Codebase size matters:** gains fall sharply as codebases grow from ~10k to ~10M lines — attributed to **context-window limits, signal-to-noise degradation, and domain-specific logic**.
- Coverage of the same research reports a **91% increase in PR review time** and a **~2.6× increase in rework** in AI-heavy workflows, i.e. the cost moved downstream from writing to reviewing. _(Secondary coverage; not read off a primary slide.)_
- Interpretation offered by the researchers in talks/coverage: quality of AI usage beats volume of AI usage; teams with clean, modular, well-tested codebases compound gains, while teams with poor code hygiene accumulate technical debt and lose trust in the tools — one proposed mechanism for the widening gap.
- Related earlier finding from the same group (separate result, widely covered ~Nov 2024): **"ghost engineers"** — ~9.5% of engineers in the dataset perform virtually no verifiable work. _(Contextual; distinct from the AI-impact analysis.)_
## Status / caveats
- The 46-vs-46 difference-in-differences result is, as of this writing, **talk/deck-published only** — presented at conferences and webinars, not (yet) in a peer-reviewed paper. The peer-reviewed papers cover the measurement methodology.
- All numbers outside the slide itself come from secondary coverage of the talks and may compress or paraphrase.
- The study's data is proprietary (companies opt in), so independent replication is not possible from outside.
## Links (all, in one place)
- Group site: https://softwareengineeringproductivity.stanford.edu/
- Sept 2025 AI Conference deck: https://aiconference.com/wp-content/uploads/2025/09/Yegor-Denisov-Blanch-Will-AI-Replace-Software-Engineers_-.pptx.pdf
- Talk video: https://www.youtube.com/watch?v=JvosMkuNxF8
- Researcher: https://yegordb.com/
- Methodology paper: https://arxiv.org/pdf/2409.15152
- Determinism paper: https://arxiv.org/pdf/2502.20747
- Screenshot that triggered this dossier: `raw/assets/G6g3O60bkAE05ZW.png`

View File

@@ -0,0 +1,198 @@
# Выводы по видео
**Источник:** https://www.youtube.com/watch?v=Nm3MsnngCJg
**Название:** Грабли во внедрении ИИ в SDLC — почему ИИ есть, а результата нет и как это лечить (Николай Шейко)
**Длительность:** 45:59
---
## Главный тезис
**ИИ в разработке уже даёт реальный прирост, но люди, компании и метрики тормозят его на порядок.** С декабря 2025 (Opus 4.5 / GPT-5.2 + Claude Code / Codex) начался настоящий скачок — SDLC схлопнулся в дни/часы. Но результат появляется только у тех, кто (а) перестал быть просто разработчиком и стал менеджером агента, (б) построил feedback loop, (в) меряет **выполненные задачи без rework**, а не строки кода / PR-ы, и (г) занимается **эволюцией системы** (skill-и, промпты, инструменты), а не одноразовыми настройками.
Ключевая цитата: *«Компаниям больше не нужна кастомная AI-разработка. Им нужно прийти, поставить Claude Code или Codex, всё настроить, прицепить коннекторы, подумать про безопасность — и это работает лучше любой кастомной».*
---
## 1. Прошлое: что уже произошло
| Событие | Что важно |
|---|---|
| Статья METR (июль 25) | Ожидали ускорение, а замер показал замедление. Но у исследования много методологических проблем |
| Стэнфордское исследование (август 25) | +20% скорости, но **разрыв между топ-перформерами и середняками растёт** — догнать всё сложнее |
| Твит Карпаты (ноябрь-декабрь 25) | Автор термина «vibe-coding» сам говорит: раньше было баловство, теперь 80% делает Claude Code, 20% дорабатываю руками |
| Статья «SDLC is dead» | Стадии жизненного цикла схлопнулись из недель в дни/часы |
**Но SDLC схлопнулся не полностью.** Осталось два «красных квадратика» — люди:
- **Ревьюер** — узкое место. Задачи копятся в очереди на ревью.
- **Планировщик / продукт** — тоже человек.
Распределение времени разработчика сдвинулось с «кодинга посередине» к «планированию слева + проверке справа».
---
## 2. Универсальная ошибка №0: разработчик ≠ менеджер
- Хороший разработчик = 3-5 часов сфокусированной работы над одной фичей (CPU-bound).
- Хороший AI-разработчик = **менеджер сотрудника-агента** (IO-bound), запускающий несколько задач параллельно.
- Если ты запустил Claude Code и **сидишь смотришь**, как он работает — ты плохой сотрудник.
- Не все психологически способны переключиться. **И это нормально** — не заставляйте всех.
---
## 3. Кейсы и ошибки
### Кейс 1: Перенос фронтенда на новый стек
| Ошибка | Лечение |
|---|---|
| Нет feedback loop у агента | Дать доступ к браузеру (Playwright / Agent Browser / Chrome DevTools) — пусть сравнивает старый vs новый фронт |
| Кранч → баги, плохая архитектура, порочный круг фиксов | Много времени на **планирование**. 20 минут — минимум, часы — норма. Каждые 10 минут планирования экономят часы. Цель — реализация за один шаг |
| Устаревшие инструменты (Cursor + оплата за токены → команда экономит) | Claude Code / Codex по подпискам |
| Внешний эксперт настраивает — «магический артефакт» | Люди должны настраивать инструменты сами. Опросник, чтобы вытащить неявные знания в инструкцию агента |
| Всех под одну гребёнку тащить в AI | Разное сопротивление — нормально. Консерваторы охраняют компанию от вайб-кодеров |
| Взяли архитектурный проект для обучения | Архитектурные ошибки стоят дорого и живут годами. Лучше начинать не с архитектуры |
**Решение по обучению команды:** записать видео → скрипт для выгрузки всех сессий → эксперт отсматривает → **пишет фидбэк команде, а команда сама правит инструкции агента** → фокус на 2 топ-перформерах (час с ними даёт 10× больше пользы, чем с остальными).
### Кейс 2: Европейский аутсорс — PR-ов больше, а прирост +1%
Причина — **rework**. Быстро задеплоили, потом много доработок.
**Ошибки метрик** (мем всех компаний):
| Не мерить | Мерить |
|---|---|
| Строки кода | Количество **выполненных** задач в единицу времени |
| Количество коммитов | (задача выполнена только если **не вернулась** на доработку) |
| Число PR-ов | Время жизни задачи + время на доработки |
**Ревью — новое узкое место.** Ручное ревью → скапливаются задачи → выгорание → снижение качества. **Решение — ревью вместе с агентом** (не вместо, а вместе). Модель = умный студент: направляйте, задавайте гипотезы, находите проблемы.
### Кейс 3: Большая кодовая база + «проклятие compaction»
- Агент собирает контекст → окно переполняется → compaction → снова добирает → снова compaction → задача еле выполняется.
- Компания решила: «раз агенты, best practices не нужны». **Ошибка.**
- Best practices нужны именно для агента: локальность, изолированные модули с интерфейсами, кодовая база хранит контекст.
- **AST Search** вместо grep на колоссальных проектах — grep выдаёт «портянку» мусора, AST даёт релевантное. Работает на разных языках.
### Мини-кейсы
- **Middle**, который внедрил AI и ускорил команду на десятки %, попросил повышение зарплаты, не получил — ушёл на сильно больше. *Если вы такой middle — задумайтесь. Если руководитель — вдвойне.*
- **Стартап, который делает spec-driven development, не зная, что хочет.** Планирование бесполезно, если нет цели. Сначала соберите UI (даже с in-memory базой в браузере) → покликайте → поймите, что нужно → потом планируйте.
---
## 4. Что будет дальше (будущее ролей)
### Появление **Product-инженера**
Планирование съедает больше времени → нужен человек, который отвечает не «как технически сделать», а «**почему** технически делаем так, чем можем пренебречь, что упростить, на что забить».
### Intelligence vs Judgment
- **Intelligence** (последовательности действий, требующие интеллекта) — AI уже отжирает.
- **Judgment** (вкус, различие полутонов, доменная экспертиза) — пока за людьми.
- Мы детектим slop в интернете, потому что там нет human touch.
- Judgment = либо **вкус, наработанный годами** (хороший код), либо **доменная экспертиза** (нефтянка, медицина).
### Разделение ролей: пользователь vs настройщик системы
Сейчас те, кто пишет код с AI, и те, кто настраивает harness — обычно одни люди. Постепенно **разделяется**:
- **Пользователи** — планирование + верификация конкретной фичи.
- **Agentic Operations** — настраивают SDLC, feedback loop-ы, инструменты, промпты, скиллы.
### Тренды на токены
- Пока **дорожают** — в ближайшее время. Позже, вероятно, начнут дешеветь.
- Сейчас — **дикий запад**. Задача — оказаться в верхней половине графика Стэнфорда.
- **Экспериментируйте на полную котлету**, пока подписки дешёвые.
---
## 5. Agentic Evolution — ключевой концепт
Как правильно обучать агента:
| Плохо | Хорошо |
|---|---|
| Спросить эксперта «как ты это делаешь» → он расскажет теорию | Взять нового сотрудника (агента) за ручку → провести по сложным задачам → показать грабли → потом сказать: *«Запомни всё это и напиши методичку следующему»* |
Без этого мы пользуемся тем, что нам дали по умолчанию. С этим — начинается вертикальный рост.
**Как верифицировать скилл:**
1. Написал скилл вместе с агентом.
2. **Не иди обедать.**
3. Запусти сабагента **без контекста** → пусть решит ту же задачу с нуля, используя только скилл.
4. Основной агент смотрит, что не так → правит скилл.
5. Так агент-ментор онбордит следующего агента.
---
## 6. Матрица «что делать / чего не делать»
### Ошибки разработчика
- Ревью полностью вручную ❌
- Отдать ревью целиком агенту ❌
- Слишком мало времени на планирование ❌
- Слишком много планирования при неясной цели ❌
- Обмазываться сабагентами / мультиагентными системами сразу ❌ (сложные системы вырастают из простых)
- Забить на эволюцию (жить с дефолтами) ❌
### Ошибки компании
- Нанять внешнего настройщика (даст рыбу, но не удочку) → **нужен препод/куратор**
- Устаревшие инструменты (Cursor с оплатой за токены)
- Всех сотрудников под одну гребёнку в AI
- Не повышать зарплату — потеряете тех, кто разобрался
- Надеяться на быстрый результат — это долгий навык
- Нанимать по-старому
- Метрики, которые легко хакаются (LoC, PR count)
---
## 7. Что можно сделать **завтра**
1. **Замкните feedback loop**, если ещё нет.
2. **Напишите скилл, который анализирует ваши сессии** хотя бы за день.
3. **Автоматизируйте**: schedule в Codex или routines в Anthropic.
4. **Голосовой ввод** (сильно больше контекста), причём **на русском** — тоже больше контекста, чем на английском.
5. **Не гоняйтесь за каждым новым инструментом** — что не всасывается в Claude Code / Codex за пару месяцев, скорее всего бесполезно.
---
## 8. Долгосрочный план
- Стать «правым» на слайде — тем, кто настраивает систему, а не пользуется.
- Вкатываться, **пока подписки дешёвые**.
- Отлаживать систему до one-shot execution (реализация за один проход, не итерации).
- Автоматический анализ сессий на **уровне команды** — искать общие паттерны, не только личные.
---
## 9. Из Q&A: заметки на полях
- **Embeddings в AI-инжиниринге / RAG поверх эмбеддингов кода** — **не работает.** Не используйте, если не понимаете *очень* хорошо, зачем.
- **Cursor не тот инструмент**, потому что: (а) отставал от Claude Code, (б) тащит старые фичи (embedding-индекс), (в) поддержка совместимости с VS Code съедает ресурсы, (г) оплата за токены → команда экономит вместо экспериментов. ~30% дороже подписок при том же уровне.
- **Дефицит железа**: H100/H600 не арендовать. Claude банит через раз, требует верификацию email. Прогноз докладчика: **AI назовут кибероружием**, введут лицензии как на биотех/фарму.
- **Китайские модели — важный тренд:**
- **GLM** (ZAI) — «красавчики», хорошая модель, есть свой GUI-клон Codex, подключается любая модель. Минус — не vision.
- **Kimi** — рабочая, есть vision (для frontend feedback loop).
- **Xiaomi агент** — интересная реализация памяти (стоит посмотреть). Head of AI перешёл туда из DeepSeek.
- **Как заставить агента справиться за один шаг:**
1. Feedback loop — must have.
2. Новая фича **goal** — чётко формулируйте реальную цель; агент сам проверяет, достигнута ли.
3. Скилл-верификация через субагента без контекста.
---
## 10. Кому это полезно
- **Тимлидам и техлидам**, которые внедряют AI и меряют строками кода (перестаньте).
- **Разработчикам,** которые сидят и смотрят, как Claude работает — пора становиться менеджером.
- **CTO** — не нанимайте внешнего настройщика, наймите куратора; повышайте зарплату тем, кто разобрался, иначе уйдут.
- **Стартаперам** — не делайте spec-driven, пока не знаете, что хотите.
- **AI-инженерам** — не суйте embeddings в код, стройте skill evolution через субагента без контекста.
- **Всем** — замкните feedback loop и включите голосовой ввод на русском **завтра**.