- BrainTools - https://www.braintools.ru -
В июле 2025 г. METR опубликовал результаты эксперимента с участием 16 опытных Open source-разработчиков. Для исследования использовали задачи из их собственных репозиториев, а участников случайным образом разделили на две группы: «с ИИ» и «без ИИ». Результат показал, что работа с использованием ИИ оказалась на 19% медленнее. При этом участники были уверены, что стали быстрее на 20%. С тех пор цифру «минус 19%» приводят в спорах о том, действительно ли ИИ помогает программистам.
После этого METR выпустил ещё два поста на ту же тему: в феврале 2026 г. — о повторном эксперименте с 57 разработчиками, в мае — о результатах опроса 349 человек. Февральский пост называется «Мы меняем схему эксперимента про продуктивность разработчиков», и посвящён не новым цифрам, а объяснению, почему старый метод перестал давать надёжные результаты. Ниже представлены все три публикации по порядку с цифрами и выводами, которые складываются при их последовательном прочтении.
Напомню условия эксперимента, потому что они важны в дальнейшем.
Кто и где:
16 разработчиков, у каждого в среднем опыт [1] работы пять лет и около 1,5 тыс. коммитов в собственном репозитории
Репозитории в среднем существуют около десяти лет и содержат более 1 млн строк
246 задач: примерно половина оформлена как Issue в репозитории, остальные созданы специально для эксперимента (подробнее — в сноске 4 статьи)
Как:
Каждую задачу случайным образом относили к условию «ИИ разрешён» или «ИИ запрещён»
Экраны участников записывались
В основном использовался инструмент Cursor Pro с Claude 3.5/3.7 Sonnet, при этом 56% участников до эксперимента не применяли Cursor
Оплата составляла $150 в час
Что ожидали и что получили:
Участники прогнозировали ускорение работы с ИИ на 24%
Экономисты, опрошенные отдельно, ожидали ускорение на 39%, а ML-эксперты — на 38%
По факту задачи при условии «ИИ разрешён» выполнялись на 19% дольше (доверительный интервал — от +2% до +39%)
После эксперимента участники по-прежнему считали, что ИИ ускорил их работу на 20%
В статье на arXiv авторы рассмотрели 21 возможную причину (не спрашивайте — в блоге упоминается 20). Пять из них подтвердились:
Разработчики переоценивали пользу ИИ
Они слишком хорошо знали свой код
Репозитории были большими и сложными
ИИ оказался ненадёжным: участники принимали менее 44% его предложений, а около 9% времени уходило на проверку и исправление
ИИ не видит неявного контекста проекта
По десяти причинам данных не хватило, а шесть были отвергнуты.
И один из абзацев из FAQ в блоге, на который тогда почти никто не обратил внимание [2]. Здесь и дальше перевод мой:
Возможно, есть опытные Open source-разработчики, которые решили не участвовать, потому что верят в значительное ускорение работы от ИИ и не хотят, чтобы их заставляли работать без него при решении половины задач. Никто из участников о таких мотивах не сообщал, но исключить это (как и другие смещения выборки) мы не можем.
Второй набор начался через месяц, и это стало главной проблемой.
Второй набор начался в августе 2025 г.
Десять человек из первого исследования и 47 новых разработчиков из более разнообразных проектов, включая небольшие и молодые
Всего — 57 разработчиков, 143 репозитория и более 800 задач
Оплата была снижена до $50 в час
Что касается инструментов, METR отмечает, что за 2025 г. среди Open source-разработчиков резко выросло использование агентов вроде Claude Code и Codex
Результаты:
У десяти «старых» участников задачи с ИИ теперь занимали на 18% меньше времени (диапазон — от −38% до +9%)
У 47 новых — на 4% меньше (диапазон — от −15% до +9%)
Оба интервала содержат ноль. METR формулирует это как «слабое свидетельство ускорения» и не рассматривает −18% в качестве результата. Вместо этого весь пост посвящён причинам ухудшения качества выборки. В резюме выделены три причины:
1. Разработчики всё чаще отказываются участвовать. Дословно: «Растущая доля разработчиков говорит, что не хочет делать 50% своей работы без ИИ — даже за $50 в час за задачи, которые они выбирают сами». METR подчёркивает, что исследование «систематически теряет разработчиков с самыми оптимистичными ожиданиями от ИИ». Один из участников первого набора ответил на приглашение так:
Я разрываюсь. Хотел бы помочь с обновлёнными данными по этому вопросу, но мне очень нравится работать с ИИ!
2. Оплата. Ставка была снижена втрое, что тоже отпугнуло многих. METR прямо указывает на это и не скрывает за первой причиной.
3. Время стало трудно измеримым. У некоторых участников агент работает над одной задачей, а человек в это время берётся за другую. Что писать в графу «часы» — непонятно.
Что касается тех, кто остался, то в опросе 30—50% участников признались, что не включают в эксперимент часть задач, потому что не хотят выполнять их без ИИ. Один из новых участников отметил (многоточие — купюра METR):
Я заметил, что на самом деле сильно смещаю выборку задач… Избегаю задач, которые ИИ сделает за два часа, а я — за 20. Будет очень больно, если выпадет «без ИИ».
Другой сравнил работу без использования ИИ с пешей прогулкой через весь город, когда привык вызывать Uber. Еще один участник не выполнил ни одной задачи из тех, что ему выпали в режиме «без ИИ». METR относит это к «менее серьёзным» проблемам — формально речь идёт всего об одном человеке. Однако именно так в 2025 г. мог выглядеть тот самый неучтённый разработчик из FAQ.
Что METR из этого выводит:
Отбор участников пока затрагивает «меньшинство разработчиков и задач, что ограничивает величину смещения». Эксперимент не превратился в мусор.
Однако оценка −18%/−4% скорее является нижней границей. Настоящий эффект «может быть намного выше» у тех, кто выпал из эксперимента.
Главная причина отбора — рост ожиданий от ИИ у разработчиков. И дальше: «По мере роста возможностей ИИ и ожиданий разработчиков эти эффекты будут только усиливаться, всё больше ограничивая валидность такой схемы.
То есть, чтобы измерить, ускоряет ли ИИ программиста, необходимо, чтобы программист иногда работал без ИИ. В начале 2025 г. за $150 в час на это соглашались, в конце 2025 г. за $50 согласившихся стало меньше, а те, кто согласился, скрывают задачи. METR предлагает бороться с этим с помощью коротких интенсивных экспериментов с высокой оплатой. Возможно, это поможет, но тренд они сами описали.
Поскольку с экспериментом возникли сложности, METR решил спросить напрямую.
Кого спрашивали:
349 технических работников (после отсева десяти анкет с противоречивыми ответами)
Среди них — 87 инженеров, 71 исследователь, 129 академиков и аспирантов, 48 фаундеров и менеджеров
Половина регулярно пользуется Claude Code
Выборка «удобная»: GitHub, университетские списки, знакомые сотрудников METR, X (доля ответивших составляла около 2%, а 70% респондентов получили вознаграждение в размере около $200)
METR, перечисляя всё это, а то же время сам отмечает, что «результаты, вероятно, страдают от существенного смещения выборки».
Что ответили:
Медианная оценка ускорения — в 3 раза
Рост ценности работы — в 1,4–2 раза, в зависимости от формулировки вопроса (METR специально разделяет понятия «скорость» и «ценность»: быстро сделать ненужный дашборд — это скорость, а не ценность)
Тот же вопрос о ценности: март 2025 г. — 1,3 раза, март 2026 г. — 2, прогноз на март 2027 г. — 2,5
Медианный респондент готов отдать 29% зарплаты за месяц доступа к ИИ — эту оценку METR называет слабой, поскольку зарплаты респондентов прикидывала языковая модель
Далее METR объясняет, почему к результатам стоит относиться с осторожностью. Не «не верим», а «есть предварительные основания для скепсиса» — именно так они формулируют позицию. Вот три наблюдения.
Первое: самые низкие оценки из всех подгрупп дали сотрудники самого METR. Авторы рассматривают четыре объяснения и «слабо склоняются» к первому (сотрудники помнят прошлогодний разрыв между ощущением и измерением). Этот разрыв METR оценивает в среднем в 40 процентных пунктов по разработчикам (по агрегатным результатам выходит 39, но расчёт ведётся по каждому участнику).
Второе: семь респондентов заявили рост ценности в 10 раз и больше. METR проанализировал каждого из них.
У двух проверили публичные результаты работы — «уверены, что оба преувеличивают; по крайней мере, в разы более ценная работа снаружи не видна»
Два участника вызывают «некоторые подозрения»
По двум участникам данных нет
Один, по мнению METR, действительно выполняет через агентов впечатляющий объём работы, хотя это скорее про количество, чем про ценность
Третье: итоговое. Такие средние показатели «не выглядят неправдоподобными», но «есть реальная вероятность, что респонденты дают большие числа, чем дали бы, подумав дольше».
В 2025 г. разработчики думали, что искусственный интеллект [3] ускорил их работу на 20%. Однако по замерам секундомера они стали медленнее на 19%. Ошибка [4] была не в цифре, а в направлении.
В 2026 г. повторить такие измерения стало сложнее. Всё больше разработчиков отказываются работать без ИИ за предлагаемое вознаграждение, а те, кто согласился, скрывают от эксперимента задачи, в которых ИИ особенно эффективен. При этом сами разработчики оценивают ускорение в 3 раза.
Вопрос «заменит ли ИИ программиста?» в таком виде не решается вообще, и три поста METR говорят не про замену, а про ускорение. Но они дают понимание самого вопроса. Он предполагает, что можно взять программиста, отобрать у него ИИ и посмотреть, что изменится. В начале 2025 г. такой эксперимент удалось провести. К концу 2025 г. контрольная группа начала распадаться, и METR ожидает, что дальше ситуация будет только ухудшаться.
Это не значит, что измерять больше нельзя. Существуют другие RCT — Peng et al. с Copilot, внутренний эксперимент Google, — но они проводились на простых или Greenfield-задачах, что METR и отмечает в своей статье. Кроме того, METR перечисляет шесть направлений для будущих исследований:
Интенсивные эксперименты с высокой оплатой
Наблюдение за реальными коммитами (по ссылке на SemiAnalysis, около 4% коммитов на GitHub уже делает Claude Code)
Опросы
Фиксированные задачи вместо собственных
Бенчмарки агентов
Рандомизация по людям, а не по задачам
У некоторых из них сразу оговорены недостатки.
Вывод для тех, кто читает новости, простой: если вы видите «ИИ ускорил нашу команду в N раз», спросите, откуда взялась эта цифра. Если из опроса, то вспомните, что в единственном известном мне сравнении субъективных оценок с секундомером люди ошиблись в знаке. Если из эксперимента — уточните, сколько платили участникам и кто отказался участвовать.
Если вы знаете свежий RCT на агентах 2026 г., где с этим всё в порядке, — поделитесь в комментариях, я такого пока не нашёл.
Автор: Igoryas
Источник [9]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35978
URLs in this post:
[1] опыт: http://www.braintools.ru/article/6952
[2] внимание: http://www.braintools.ru/article/7595
[3] интеллект: http://www.braintools.ru/article/7605
[4] Ошибка: http://www.braintools.ru/article/4192
[5] METR, 10 июля 2025 — Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity: https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/
[6] Becker, Rush, Barnes, Rein — полная статья, arXiv 2507.09089: https://arxiv.org/abs/2507.09089
[7] METR, 24 февраля 2026 — We are Changing our Developer Productivity Experiment Design: https://metr.org/blog/2026-02-24-uplift-update/
[8] METR, 11 мая 2026 — Measuring the Self-Reported Impact of Early-2026 AI on Technical Worker Productivity: https://metr.org/blog/2026-05-11-ai-usage-survey/
[9] Источник: https://habr.com/ru/companies/domclick/articles/1085232/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1085232
Нажмите здесь для печати.