Следующая редакция: AI-native — проверка исходов E4, итоговый срез v0.9 →
AI-native — проверка исходов E4, промежуточный срез v0.3
Из 112 разобранных случаев независимую проверку выдержали 10. Это меньше десятой части цели в 120. Причина не только в объёме: корпоративные истории об ИИ почти всегда остаются самоотчётом компании. Независимо подтверждаются в основном…
Заголовок источника
Что выдержало независимую проверку
О статусе материала
review
Из 112 разобранных случаев независимую проверку выдержали 10. Это меньше десятой части цели в 120. Причина не только в объёме: корпоративные истории об ИИ почти всегда остаются самоотчётом компании. Независимо подтверждаются в основном провалы, которые разбирали суды, регуляторы и журналисты, и научные исследования на данных компаний. Среди засчитанных случаев 6 неуспехов, 3 смешанных исхода и 1 успех. Такое соотношение показывает, что именно удаётся проверить, а не то, как часто внедрения ИИ проваливаются.
Срез промежуточный. Работа остановлена по решению владельца, когда исчерпался лимит веб-поиска сессии (200 запросов, общий для координатора и всех исполнителей). Из волны A (149 кандидатов) разобраны 92. Кандидаты без заявленного исхода (волна B, 161) не разбирались. Новые поиски неуспехов (W7) и независимо измеренных исходов (W8) выполнены по одному направлению из трёх и из четырёх. Основание работы — план v0.7 — E4. Все 112 вердиктов с замечаниями — в таблице вердиктов.
План, факт, пробел
| Показатель | План | Факт v0.3 | Пробел |
|---|---|---|---|
| Проверенные случаи A/B с установленным исходом | ≥ 120 | 10 | 110 |
| Из них неуспешные и смешанные | ≥ 30, обе категории | 9 (6 неуспехов, 3 смешанных) | 21 |
| Независимая перепроверка кандидатов в 120 | все | все 10 | — |
| Независимая перепроверка остальных | ≥ 25% | 60 из 102; в 5 пакетах без предложений в 120 перепроверки не было | 5 пакетов |
| Разбор волны A | 149 | 92 | 57 (9 пакетов) |
| Разбор волны B | 161 | 0 | 161 |
| Россия / Китай / США / другие страны среди засчитанных | покрытие всех | 0 / 1 / 5 / 4 | Россия |
Порог 120 не снижен. На текущих данных он недостижим: волна A даёт засчитанный случай примерно на каждые 13 разобранных (7 из 92), а у волны B исход даже не заявлен. Путь к 120 — случаи, где исход измерил не сама компания. Он описан в разделе «Как продолжить».
Засчитанные случаи
| Случай | Исход | Почему засчитан | Оговорка |
|---|---|---|---|
| Air Canada, чат-бот о льготном тарифе | неуспех | Решение трибунала Британской Колумбии, пересказанное двумя независимыми изданиями | Единичный инцидент; тип чат-бота (модель или сценарии) не назван; текст решения не открылся |
| Deloitte, отчёт для DEWR | неуспех | Письмо Deloitte, раскрытое по FOI, признаёт, что ошибки внесли ИИ-инструменты; есть независимое подтверждение | Масштаб неуспеха не раскрыт: сумма возврата и число ошибочных ссылок неизвестны |
| Нью-Йорк, чат-бот MyCity | неуспех | Независимые тесты бота и последующее отключение | Доля ошибок не измерена, есть только примеры |
| McDonald's и IBM, приём заказов на drive-thru | неуспех | Заявление McDonald's о завершении партнёрства и отключение пилота | Провал конкретного пилота и поставщика, а не отказ от голосового заказа |
| Amazon Just Walk Out | неуспех | Отказ от технологии в Fresh, затем закрытие всех Amazon Go и Fresh в США (январь 2026) | Причины не установлены; цифры о ручной проверке видео не подтверждены |
| Baidu Apollo Go, Ухань | неуспех | Массовая остановка автономных такси и приостановка сервиса во всём городе | Провал на уровне инцидента, не всей программы |
| Klarna, поддержка клиентов | смешанный | Проспект для SEC и аудированные расходы на поддержку: $287 → $240 → $203 млн за 2022–2024 | Расходы падали и до ИИ; проспект заявляет прежнее качество, CEO говорил о его снижении |
| ИИ-скрайбы в пяти медицинских системах США | смешанный | JAMA 2026: 8 581 клиницист, −16 минут документирования (−10%), время вне работы значимо не изменилось | Наблюдательное сравнение пользователей и непользователей, не рандомизация |
| Accenture, GitHub Copilot | смешанный | Рандомизированный эксперимент: сборок больше, доля успешных сборок ниже на 17,4% | Прирост основного показателя (PR) незначим; двое соавторов — сотрудники Microsoft |
| Microsoft, GitHub Copilot | успех | Та же статья: PR +27%, широкий доверительный интервал (примерно +2…+53%) | Конфликт интересов; эксперимент зарегистрирован постфактум. Общий источник с Accenture: взаимно не подтверждают |
Уровня A не получил ни один случай. Проверяющие понизили до B все предложенные авторами A: не хватало прозрачного измерения масштаба либо независимости от поставщика.
Что показала проверка
Корпоративный самоотчёт и его перепечатки — один источник. Из 92 кандидатов волны A 76 остались на уровне C. Во всех 15 российских случаях независимого подтверждения нет: только релизы, интервью и их пересказы. Калибровочная перепроверка пакетов RU-01 и CN-01 не нашла завышенной строгости. Годовой отчёт с цифрами эффекта ИИ тоже остаётся данными компании: аудит финансовой отчётности не распространяется на оценку вклада ИИ.
Признание WEF Lighthouse не подтверждает цифры. Метрики эффекта подаёт сама компания, методика проверки чисел не опубликована. Правило для всех пакетов: одного Lighthouse недостаточно для B. Поэтому EVE Energy, CATL, Midea и AUO остались на уровне C.
Провалы проверяются лучше успехов. Суды, регуляторы, закрытия и отзывы оставляют следы независимого происхождения. Из-за этого засчитанные случаи смещены к неуспехам. Это свойство доказательной базы, а не оценка доли неудачных внедрений.
Научные исследования на данных компаний — самый продуктивный источник, но со своими ловушками. В пакете W8 12 исследований, засчитаны два. Остальные отклонены: эксперимент на специально сконструированных задачах (BCG), участники — оплачиваемые добровольцы, а не организация (METR), неизданный инструмент поставщика, в котором работают шесть из семи соавторов (патентные фирмы), нет генеративного ИИ или период до 2023 года. У METR после исследования 2025 года вышло обновление (февраль 2026) с противоположной оценкой, так что исход «неуспех» относится только к инструментам начала 2025 года.
Инцидент с продуктом — не исход изменения работы. Авария Xiaomi, ошибка модерации iFlytek и падение акций не засчитаны: они говорят о безопасности продукта, а не о том, как ИИ изменил работу организации. Реакция биржи и начатая проверка не подтверждают исход.
Ограничения среза
- Поздние события — откаты, опровержения, иски — в большинстве пакетов не искались: веб-поиск исчерпался во время работы. Каждый вердикт с этим ограничением помечен в замечаниях проверяющего.
- Поля
quote_originalу исполнителей часто оказывались пересказом, который вернул инструмент чтения страниц, а не дословной цитатой. Проверяющие сами открывали ключевые источники засчитанных случаев и сверяли числа. Дословность каждой цитаты проверена не во всех пакетах, поэтому любую цитату без отдельного подтверждения проверяющего нужно считать пересказом. - Часть первоисточников не открылась: 403 у CanLII, SSRN, INFORMS, TASS, Becker's и других; ошибки соединения у ряда китайских сайтов. Замены и пробелы указаны в карточках.
- Категории случаев назначены авторами и проверяющими не пересматривались. Например, Copilot отнесён к «агентному взаимодействию»; перед синтезом категории нужно выверить.
- Исполнители и проверяющие — модели Claude разных уровней в отдельных контекстах. Независимость здесь означает самостоятельное чтение источников, а не независимость людей или организаций.
- Процессные сбои: один исполнитель запускал собственных субагентов, и они перезаписывали общий файл; у другого временные файлы смешались с соседним пакетом. Оба инцидента исполнители исправили сами. Координатор сверил все 14 файлов пакетов со входами — расхождений нет.
Как продолжить
- Поднять лимит веб-поиска (
CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION) или продолжить в новой сессии. Без поиска нельзя проверить поздние события и найти новые случаи. - В первую очередь — независимо измеренные исходы: оставшиеся направления W8 (операционные процессы, решения регуляторов и судов, раскрытие с независимым подтверждением) и W7 (неуспехи в США и Европе/других странах). Здесь выход засчитанных случаев выше, чем у корпоративной очереди.
- Дочитать 9 пакетов волны A. Там уже известны сильные кандидаты: дубли исследований из W8 — клиентская поддержка по Бриньолфссону и другие.
- Вернуть на повторную проверку случаи с шансом на B при доступном поиске: оценка Всемирного банка в штате Эдо, карточки EuroChem и «Технологии Доверия» (needs_rework).
- Волну B запускать выборочно, где у кандидата есть признаки независимых данных. Целиком она вряд ли окупится.
- Если пригодных публичных случаев не хватит, пересогласовать с владельцем объём или определение уровня B. Молча порог не снижается.
Реестры: 01 Реестры/v0.3/e4_verdicts.jsonl и manifest.json. Реестры v0.2 не изменены. Рабочие материалы, задания и решения координатора лежат в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены.