AI Native
Разбор случая

Accenture — Copilot не доказал рост продуктивности разработчиков, зато снизил долю успешных сборок

Коротко. Accenture дала доступ к GitHub Copilot части разработчиков в офисах Юго-Восточной Азии — случайным образом, с обучением и поощрением менеджеров. Число попыток собрать код (скомпилировать проект и проверить, что он работает)…

Заголовок источника

У разработчиков Accenture Copilot не доказал рост выработки, но снизил долю успешных сборок кода

О статусе материала

review

Коротко. Accenture дала доступ к GitHub Copilot части разработчиков в офисах Юго-Восточной Азии — случайным образом, с обучением и поощрением менеджеров. Число попыток собрать код (скомпилировать проект и проверить, что он работает) выросло почти вдвое, но доля успешных сборок статистически значимо упала. По мнению авторов, главный показатель выработки — число pull request в неделю (запросов на слияние готового кода в общий проект): он значимо не изменился.

Что изменили

До эксперимента разработчики Accenture писали код без ИИ-подсказок. С конца июля по декабрь 2023 года 320 разработчиков случайным образом распределили: 61,3% получили доступ к GitHub Copilot, остальные остались в контрольной группе. Менеджеры участников прошли обучающую сессию и должны были поощрять использование инструмента в командах. Решение о принятии кода по-прежнему оставалось за разработчиком и ревьюером: Copilot только предлагал подсказки при написании кода.

Как измерили

Это рандомизированный эксперимент на уровне отдельного разработчика: его провела сама компания и передала независимым исследователям как часть более крупной работы о трёх полевых экспериментах с ИИ у разработчиков (Cui, Demirer, Jaffe, Musolff, Peng, Salz, Management Science, 2026; рабочая версия открыта на сайте одного из авторов). Данные по Accenture — отдельный столбец в таблице результатов той же статьи, которая описывает похожий эксперимент в Microsoft.

У этого источника есть свой конфликт интересов: двое соавторов работают в Microsoft, разработчике Copilot; кроме того, авторы зарегистрировали эксперимент задним числом (пост-регистрация — план анализа оформили уже после сбора части данных, что снижает доверие к результату). Из-за него, а не из-за характера самих цифр по Accenture (результат по качеству кода тут как раз невыгоден поставщику), уровень доказательности понижен с заявленного автором A до B — для единообразия с похожим экспериментом Microsoft. Поиск поздних публикаций-опровержений не проводился; их отсутствие в открытых источниках не означает, что их нет.

Что получилось

Число сборок кода в неделю выросло на 92,4% относительно контрольной группы (стандартная ошибка 26,78, значимо на уровне 1%; 95% доверительный интервал: примерно от +40% до +145%). Одновременно доля успешных сборок (показатель качества кода) упала на 17,4% относительно контрольного среднего (стандартная ошибка 7,12, значимо на уровне 5%; интервал: примерно от −31% до −3%).

По мнению авторов, основной индикатор выработки — число pull request в неделю: оно выросло на 17,9%, но статистически незначимо (доверительный интервал широкий, от −19% до +55%); число коммитов (отдельных сохранённых изменений кода) почти не изменилось (−4,5%, тоже незначимо). То есть доказанного роста выработки эксперимент не показал — значимы только рост числа попыток сборки и снижение их успешности.

Отдельно у Accenture шёл второй, фактически заброшенный эксперимент: его прервали из-за крупного сокращения штата, затронувшего 42% участников, из-за чего пропали данные об использовании Copilot. При консервативной оценке статуса внедрения точечная оценка эффекта на число pull request отрицательна (−39,2%), но статистически незначима — слишком большой разброс.

Почему так вышло

Авторы статьи сами предлагают объяснение: доступ к ИИ может подталкивать разработчиков к стилю «проб и ошибок» — принимать подсказки Copilot, а затем компилировать проект, чтобы найти ошибки. Такой сдвиг мог бы объяснить и рост числа сборок, и падение доли успешных, но сами авторы пишут, что результаты лишь «(слабо) подтверждают» эту интерпретацию для Accenture. Причина не установлена.

Чему учит

  • Рост «активности» (сборки, коммиты) — не то же самое, что рост выработки: нужно смотреть на главный показатель результата (здесь — pull request), а не на побочные метрики.
  • ИИ-подсказки в программировании могут провоцировать стиль «сначала прими подсказку, потом проверь компиляцией» — это увеличивает число попыток и может снижать долю успешных с первого раза.
  • Общий источник данных с похожим экспериментом другой компании — повод понизить уровень доверия для согласованности оценки, даже если конкретный результат невыгоден поставщику инструмента.
  • Организационная турбулентность (сокращения штата) может сорвать сбор данных о самом внедрении ИИ — её стоит учитывать отдельно, не смешивая с эффектом инструмента.

Источники

Уровень доказательности: B. Понижен с заявленного авторами A для единообразия с похожим экспериментом Microsoft из той же статьи — у двух соавторов есть связь с Microsoft/GitHub, регистрация задним числом. Поиск поздних опровержений не проводился. Исход — смешанный, но с оговоркой: значим только рост числа сборок и падение доли успешных; главный показатель выработки (pull request) статистически не изменился.