AI Native
Историческая редакцияСохранена для понимания развития проекта.
Исследования

AI-native — проверка исходов E4, промежуточный срез v0.3

Из 112 разобранных случаев независимую проверку выдержали 10. Это меньше десятой части цели в 120. Причина не только в объёме: корпоративные истории об ИИ почти всегда остаются самоотчётом компании. Независимо подтверждаются в основном…

Заголовок источника

Что выдержало независимую проверку

О статусе материала

review

Из 112 разобранных случаев независимую проверку выдержали 10. Это меньше десятой части цели в 120. Причина не только в объёме: корпоративные истории об ИИ почти всегда остаются самоотчётом компании. Независимо подтверждаются в основном провалы, которые разбирали суды, регуляторы и журналисты, и научные исследования на данных компаний. Среди засчитанных случаев 6 неуспехов, 3 смешанных исхода и 1 успех. Такое соотношение показывает, что именно удаётся проверить, а не то, как часто внедрения ИИ проваливаются.

Срез промежуточный. Работа остановлена по решению владельца, когда исчерпался лимит веб-поиска сессии (200 запросов, общий для координатора и всех исполнителей). Из волны A (149 кандидатов) разобраны 92. Кандидаты без заявленного исхода (волна B, 161) не разбирались. Новые поиски неуспехов (W7) и независимо измеренных исходов (W8) выполнены по одному направлению из трёх и из четырёх. Основание работы — план v0.7 — E4. Все 112 вердиктов с замечаниями — в таблице вердиктов.

План, факт, пробел

Показатель План Факт v0.3 Пробел
Проверенные случаи A/B с установленным исходом ≥ 120 10 110
Из них неуспешные и смешанные ≥ 30, обе категории 9 (6 неуспехов, 3 смешанных) 21
Независимая перепроверка кандидатов в 120 все все 10 —
Независимая перепроверка остальных ≥ 25% 60 из 102; в 5 пакетах без предложений в 120 перепроверки не было 5 пакетов
Разбор волны A 149 92 57 (9 пакетов)
Разбор волны B 161 0 161
Россия / Китай / США / другие страны среди засчитанных покрытие всех 0 / 1 / 5 / 4 Россия

Порог 120 не снижен. На текущих данных он недостижим: волна A даёт засчитанный случай примерно на каждые 13 разобранных (7 из 92), а у волны B исход даже не заявлен. Путь к 120 — случаи, где исход измерил не сама компания. Он описан в разделе «Как продолжить».

Засчитанные случаи

Случай Исход Почему засчитан Оговорка
Air Canada, чат-бот о льготном тарифе неуспех Решение трибунала Британской Колумбии, пересказанное двумя независимыми изданиями Единичный инцидент; тип чат-бота (модель или сценарии) не назван; текст решения не открылся
Deloitte, отчёт для DEWR неуспех Письмо Deloitte, раскрытое по FOI, признаёт, что ошибки внесли ИИ-инструменты; есть независимое подтверждение Масштаб неуспеха не раскрыт: сумма возврата и число ошибочных ссылок неизвестны
Нью-Йорк, чат-бот MyCity неуспех Независимые тесты бота и последующее отключение Доля ошибок не измерена, есть только примеры
McDonald's и IBM, приём заказов на drive-thru неуспех Заявление McDonald's о завершении партнёрства и отключение пилота Провал конкретного пилота и поставщика, а не отказ от голосового заказа
Amazon Just Walk Out неуспех Отказ от технологии в Fresh, затем закрытие всех Amazon Go и Fresh в США (январь 2026) Причины не установлены; цифры о ручной проверке видео не подтверждены
Baidu Apollo Go, Ухань неуспех Массовая остановка автономных такси и приостановка сервиса во всём городе Провал на уровне инцидента, не всей программы
Klarna, поддержка клиентов смешанный Проспект для SEC и аудированные расходы на поддержку: $287 → $240 → $203 млн за 2022–2024 Расходы падали и до ИИ; проспект заявляет прежнее качество, CEO говорил о его снижении
ИИ-скрайбы в пяти медицинских системах США смешанный JAMA 2026: 8 581 клиницист, −16 минут документирования (−10%), время вне работы значимо не изменилось Наблюдательное сравнение пользователей и непользователей, не рандомизация
Accenture, GitHub Copilot смешанный Рандомизированный эксперимент: сборок больше, доля успешных сборок ниже на 17,4% Прирост основного показателя (PR) незначим; двое соавторов — сотрудники Microsoft
Microsoft, GitHub Copilot успех Та же статья: PR +27%, широкий доверительный интервал (примерно +2…+53%) Конфликт интересов; эксперимент зарегистрирован постфактум. Общий источник с Accenture: взаимно не подтверждают

Уровня A не получил ни один случай. Проверяющие понизили до B все предложенные авторами A: не хватало прозрачного измерения масштаба либо независимости от поставщика.

Что показала проверка

Корпоративный самоотчёт и его перепечатки — один источник. Из 92 кандидатов волны A 76 остались на уровне C. Во всех 15 российских случаях независимого подтверждения нет: только релизы, интервью и их пересказы. Калибровочная перепроверка пакетов RU-01 и CN-01 не нашла завышенной строгости. Годовой отчёт с цифрами эффекта ИИ тоже остаётся данными компании: аудит финансовой отчётности не распространяется на оценку вклада ИИ.

Признание WEF Lighthouse не подтверждает цифры. Метрики эффекта подаёт сама компания, методика проверки чисел не опубликована. Правило для всех пакетов: одного Lighthouse недостаточно для B. Поэтому EVE Energy, CATL, Midea и AUO остались на уровне C.

Провалы проверяются лучше успехов. Суды, регуляторы, закрытия и отзывы оставляют следы независимого происхождения. Из-за этого засчитанные случаи смещены к неуспехам. Это свойство доказательной базы, а не оценка доли неудачных внедрений.

Научные исследования на данных компаний — самый продуктивный источник, но со своими ловушками. В пакете W8 12 исследований, засчитаны два. Остальные отклонены: эксперимент на специально сконструированных задачах (BCG), участники — оплачиваемые добровольцы, а не организация (METR), неизданный инструмент поставщика, в котором работают шесть из семи соавторов (патентные фирмы), нет генеративного ИИ или период до 2023 года. У METR после исследования 2025 года вышло обновление (февраль 2026) с противоположной оценкой, так что исход «неуспех» относится только к инструментам начала 2025 года.

Инцидент с продуктом — не исход изменения работы. Авария Xiaomi, ошибка модерации iFlytek и падение акций не засчитаны: они говорят о безопасности продукта, а не о том, как ИИ изменил работу организации. Реакция биржи и начатая проверка не подтверждают исход.

Ограничения среза

  • Поздние события — откаты, опровержения, иски — в большинстве пакетов не искались: веб-поиск исчерпался во время работы. Каждый вердикт с этим ограничением помечен в замечаниях проверяющего.
  • Поля quote_original у исполнителей часто оказывались пересказом, который вернул инструмент чтения страниц, а не дословной цитатой. Проверяющие сами открывали ключевые источники засчитанных случаев и сверяли числа. Дословность каждой цитаты проверена не во всех пакетах, поэтому любую цитату без отдельного подтверждения проверяющего нужно считать пересказом.
  • Часть первоисточников не открылась: 403 у CanLII, SSRN, INFORMS, TASS, Becker's и других; ошибки соединения у ряда китайских сайтов. Замены и пробелы указаны в карточках.
  • Категории случаев назначены авторами и проверяющими не пересматривались. Например, Copilot отнесён к «агентному взаимодействию»; перед синтезом категории нужно выверить.
  • Исполнители и проверяющие — модели Claude разных уровней в отдельных контекстах. Независимость здесь означает самостоятельное чтение источников, а не независимость людей или организаций.
  • Процессные сбои: один исполнитель запускал собственных субагентов, и они перезаписывали общий файл; у другого временные файлы смешались с соседним пакетом. Оба инцидента исполнители исправили сами. Координатор сверил все 14 файлов пакетов со входами — расхождений нет.

Как продолжить

  1. Поднять лимит веб-поиска (CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION) или продолжить в новой сессии. Без поиска нельзя проверить поздние события и найти новые случаи.
  2. В первую очередь — независимо измеренные исходы: оставшиеся направления W8 (операционные процессы, решения регуляторов и судов, раскрытие с независимым подтверждением) и W7 (неуспехи в США и Европе/других странах). Здесь выход засчитанных случаев выше, чем у корпоративной очереди.
  3. Дочитать 9 пакетов волны A. Там уже известны сильные кандидаты: дубли исследований из W8 — клиентская поддержка по Бриньолфссону и другие.
  4. Вернуть на повторную проверку случаи с шансом на B при доступном поиске: оценка Всемирного банка в штате Эдо, карточки EuroChem и «Технологии Доверия» (needs_rework).
  5. Волну B запускать выборочно, где у кандидата есть признаки независимых данных. Целиком она вряд ли окупится.
  6. Если пригодных публичных случаев не хватит, пересогласовать с владельцем объём или определение уровня B. Молча порог не снижается.

Реестры: 01 Реестры/v0.3/e4_verdicts.jsonl и manifest.json. Реестры v0.2 не изменены. Рабочие материалы, задания и решения координатора лежат в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены.