AI Native
Разбор случая

NAV IT (Норвегия) — Copilot не дал измеримого роста продуктивности разработчиков

Коротко. NAV IT — техподразделение норвежского государственного агентства занятости и соцвыплат — открыло разработчикам добровольный доступ к GitHub Copilot (ИИ-помощник, который подсказывает и дописывает код прямо в редакторе)…

Заголовок источника

У разработчиков NAV, взявших Copilot, коммиты были частыми ещё до его появления — дело в самоотборе

О статусе материала

review

Коротко. NAV IT — техподразделение норвежского государственного агентства занятости и соцвыплат — открыло разработчикам добровольный доступ к GitHub Copilot (ИИ-помощник, который подсказывает и дописывает код прямо в редакторе) в сентябре 2023 года. Независимые исследователи два года следили за активностью коммитов и качеством кода. Вывод: статистически значимого роста продуктивности от инструмента не нашли. Разница между пользователями и непользователями существовала ещё до его появления.

Что изменили

До сентября 2023 года разработчики NAV IT писали код без ИИ-подсказок. Затем 100 разработчиков получили добровольный доступ к Copilot — не по распоряжению руководства, а по желанию; к маю 2025 года пользователей стало 250. Часть скептически настроенных разработчиков сознательно отказалась от инструмента, посчитав его излишним при своих архитектурных практиках. Никакого обязательного внедрения или формального изменения процесса не было — только опция, доступная тем, кто хотел её попробовать.

Как измерили

Это продольное наблюдательное исследование (наблюдение за одними и теми же людьми на протяжении двух лет), а не рандомизированный эксперимент. Исследователи из Университета Осло и SINTEF (крупнейший независимый научно-исследовательский институт Норвегии; сотрудников NAV среди авторов нет, в статье только благодарность NAV IT) собрали 26 317 коммитов из 703 публичных репозиториев NAV IT на GitHub за 105 недель, провели 13 интервью (ноябрь–декабрь 2023) и опрос 63 разработчиков с привязкой к их GitHub-логину (март–апрель 2024). Из них для количественного сравнения «до и после» отобрали 39 разработчиков: 25 пользователей Copilot и 14 непользователей. Статья прошла рецензирование и опубликована в трудах конференции HICSS-59 (2026).

Слабое место: выборка с привязанными логинами небольшая (39 человек при 250 пользователях Copilot к маю 2025 года), и главное — нет рандомизации: кто взял Copilot, а кто нет, решали сами разработчики, поэтому сравнение групп подвержено самоотбору (более активные люди чаще пробуют новое сами, без всякого влияния инструмента).

Что получилось

Пользователи Copilot коммитили в среднем более чем вдвое чаще, чем непользователи — и до появления инструмента в организации, и после: разница значима по критерию Манна–Уитни (тесту, который сравнивает две группы без предположения, что данные распределены «по колоколу») при пороге p < 0,00555. Авторы объясняют разницу самоотбором: более активные разработчики раньше и охотнее попробовали инструмент. Заметного скачка активности в момент введения инструмента не произошло ни у одной группы.

У пользователей Copilot после внедрения чистый объём изменений кода чуть вырос: авторы пишут о +16 строках в неделю, хотя по их же числам выходит +19 (добавления выросли со 188 до 200, удаления снизились со 105 до 98). У непользователей объём почти не изменился. Структурные метрики качества кода (сложность функций, средний размер модуля) статистически значимо не изменились ни у одной группы: ухудшения качества не произошло.

Субъективная оценка продуктивности по опросу не коррелировала с реально измеренной активностью (корреляция Спирмена ≈0,17 — то есть почти никакой связи; статистически незначима). Разработчики могли чувствовать, что стали продуктивнее, хотя цифры это не подтверждали.

Почему так вышло

Авторы прямо указывают на эффект самоотбора: разработчики, уже отличавшиеся более высокой активностью, охотнее и раньше брали новый инструмент — поэтому наблюдаемая разница между группами отражает исходные различия, а не влияние Copilot. Без рандомизации отделить причину от следствия нельзя: возможно, дело в разнице ролей, стажа или типа задач, а не в самом инструменте. Исследование, впрочем, не нашло и вреда: код не стал хуже, только не стал измеримо лучше.

Чему учит

  • Добровольное внедрение без рандомизации почти всегда порождает самоотбор: активные сотрудники берут инструмент первыми, и наблюдаемая разница выглядит как эффект инструмента, хотя им не является.
  • Субъективное ощущение «стало продуктивнее» не всегда подтверждается объективными метриками — стоит проверять оба источника, а не полагаться на один.
  • Отсутствие роста продуктивности не то же самое, что вред: качество кода в этом случае не пострадало, изменился только вывод о пользе.
  • Долгий период наблюдения (два года) и большая база коммитов не заменяют рандомизацию: без контрольной группы, сформированной случайно, причинный вывод остаётся под вопросом.

Источники

Уровень доказательности: B. Рецензируемое исследование независимых авторов на первичных данных (коммиты, опрос, интервью), но без рандомизации и с эффектом самоотбора — второго независимого подтверждения именно этого нулевого результата нет. Исход — неуспех по заявленной цели «Copilot повышает измеримую продуктивность»: цель не достигнута, но и вреда качеству кода не обнаружено.