AI Native
Историческая редакцияСохранена для понимания развития проекта.
Исследования

AI-native — проверка исходов E4, срез v0.4

Независимую проверку выдержали 20 случаев из 120 (в v0.3 было 10). Волна A (149 кандидатов) теперь разобрана целиком, но в 120 дала только 9 случаев. Остальные 11 пришли из прицельного поиска неуспехов (W7) и исходов, которые измерил…

Заголовок источника

Что выдержало независимую проверку — срез v0.4

О статусе материала

review

Независимую проверку выдержали 20 случаев из 120 (в v0.3 было 10). Волна A (149 кандидатов) теперь разобрана целиком, но в 120 дала только 9 случаев. Остальные 11 пришли из прицельного поиска неуспехов (W7) и исходов, которые измерил кто-то кроме компании (W8). Среди 20 засчитанных 13 неуспехов, 5 смешанных исходов и 2 успеха. Это показывает, какие случаи удаётся проверить по открытым источникам, а не то, насколько часто внедрения ИИ проваливаются. На текущем выходе цель 120 в рамках одной-двух сессий недостижима. Нужно решение владельца (см. «Решение для владельца»).

Срез продолжает v0.3 по поручению владельца «продолжи E4 по CHECKPOINT» от 23 сентября 2026 года. Работа снова остановилась на лимите веб-поиска сессии: израсходовано около 196 из 200 поисков. Основание — план v0.7 — E4. Все 219 вердиктов с замечаниями проверяющих — в таблице вердиктов v0.4.

План, факт, пробел

Показатель План v0.3 v0.4 Пробел
Проверенные случаи A/B с установленным исходом ≥ 120 10 20 (A — 2, B — 18) 100
Из них неуспешные и смешанные ≥ 30 9 18 (13 + 5) 12
Независимая перепроверка кандидатов в 120 все все все —
Независимая перепроверка остальных ≥ 25% 60 из 102 113 из 199 12 пакетов A без предложений в 120 не перепроверялись
Разбор волны A 149 92 149 —
Разбор волны B 161 0 0 161
Новые случаи W7 (неуспехи) по дефициту 8 29 —
Новые случаи W8 (независимое измерение) по дефициту 12 41 —
Россия / Китай / США / другие страны среди засчитанных покрытие всех 0 / 1 / 5 / 4 0 / 1 / 11 / 8 Россия, Китай

Всего 219 вердиктов по 209 разным случаям. 10 записей — дубли: параллельные пакеты находили одни и те же случаи, каждый засчитан не больше одного раза. Решения координатора о дублях, окне дат и регионах — в 02 Рабочие материалы/e4-v07/adjudications.json.

Засчитанные случаи

Новые в v0.4 — 10 случаев:

Случай Уровень, исход Почему засчитан Оговорка
Presto Automation, голосовой приём заказов на drive-thru B, неуспех Приказ SEC (14.01.2025): около 70% заказов в июне–декабре 2023 года требовали вмешательства людей на Филиппинах и в Индии Урегулирование без признания; методика подсчёта 70% в приказе не раскрыта
Техподдержка анонимной компании из Fortune 500 (Бриньолфссон, Ли, Рэймонд) B, смешанный QJE, 2025: +15% решённых обращений в час; у самых опытных операторов качество немного падает Внедрение 2020–2021 годов; данные одной компании получены через вендора ИИ; конфликт интересов соавтора раскрыт
MASAI, скрининг рака груди в Сконе (Швеция) A, успех РКИ в рутинном скрининге: чувствительность 80,5% против 73,8%, нагрузка на врачей −44% Снижение интервального рака (−12%) статистически незначимо: результат «не хуже», а не «лучше»
Cruise (GM), беспилотное такси A, неуспех Приостановка разрешения DMV, штраф NHTSA $1,5 млн, соглашение с Минюстом ($500 тыс., признание ложного отчёта), прекращение финансирования GM Сокращено около 1 150 из 2 300 сотрудников
NEDA, чат-бот Tessa вместо горячей линии B, неуспех Бот отключён 30.05.2023 после вредных советов по питанию NEDA и поставщик спорят, кто добавил генеративный ИИ
Rite Aid, распознавание лиц в магазинах B, неуспех Запрет FTC на 5 лет и удаление снимков и моделей Выводы FTC основаны на жалобе, закрытой урегулированием; Rite Aid с ними не согласна; система работала до 2020 года
Gannett, ИИ-заметки о школьном спорте (LedeAI) B, смешанный Пауза после публичных ошибок; независимые наблюдения Axios, CNN, Washington Post Ошибки в «небольшой части из 1 000+ статей»; от ИИ в редакции Gannett не отказалась
Амстердам, пилот Smart Check B, неуспех ML-модель после перевзвешивания стала чаще ошибочно отмечать другие группы; пилот остановлен Дата закрытия расходится: ноябрь 2023 года (совет города) или осень 2024 года (Lighthouse)
Försäkringskassan (Швеция), риск-скоринг проверок B, неуспех Независимое измерение справедливости (Lighthouse, Svenska Dagbladet, 2024); регулятор IMY зафиксировал вывод ML-модели из эксплуатации в 2025 году Официальная причина отказа от модели не названа
Полиция Детройта, распознавание лиц B, неуспех Урегулирование 28.06.2024: выплата $300 тыс. и новая политика (подтверждено AP) Технология применялась с 2017 года; поиск выполняла полиция штата

Засчитанные ранее 10 случаев (подробности — в v0.3): Air Canada, Deloitte/DEWR, Нью-Йорк MyCity, McDonald's и IBM, Amazon Just Walk Out, Baidu Apollo Go, Klarna, ИИ-скрайбы в пяти медицинских системах США, GitHub Copilot в Microsoft и в Accenture.

Правило окна дат, принятое координатором. Для периода 2023–2026 берётся дата установления исхода (решение суда или регулятора, закрытие, публикация измерения), а не дата внедрения. Ранние случаи допускаются по плану v0.4 (раздел 1) с объяснением релевантности. Это правило затрагивает Rite Aid, Детройт и исследование Бриньолфссона. Если владелец выберет окно по дате внедрения, эти три случая выйдут из 120. Роттердам исключён: модель остановлена в 2021 году.

Что показала проверка

Проверяющие отклоняют большинство предложений исполнителей. В новых пакетах W7 и W8 исполнители предложили в 120 39 случаев, проверку прошли 7. Ещё один случай (Försäkringskassan) проверяющий добавил сам. В волне A из 5 предложений прошли 2. Причины отказа повторяются:

  • Роль ИИ не установлена. Жёсткий фильтр по возрасту в iTutorGroup, трудовые споры курьеров Glovo, Deliveroo и iFood, кредитный скоринг SCHUFA: суды решали вопросы трудового статуса и GDPR, а машинное обучение нигде не установлено.
  • ИИ в продукте, а не в работе компании. Tesla Autopilot, штрафы Clearview и OpenAI: это санкции против поставщика за свойства его продукта, а не изменение работы организации. Штраф OpenAI в Италии суд аннулировал 18.03.2026; урегулирование Clearview в США отменено апелляцией 13.07.2026.
  • Решение вместо исхода. Сокращения «из-за ИИ» в IBM, SAP, Intuit, Workday и Amazon — это объявленные решения, а не измеренный результат. CEO Amazon 30.10.2025 сам сказал, что сокращения «not even really AI-driven».
  • Подтверждение того же происхождения. Истцы и их адвокаты, пересказ интервью компании, реакция рынка, анонимные источники. Независимость соавторов статьи не делает независимыми данные компании (Alibaba, JD.com, P&G).
  • Точность модели вместо исхода работы. Сравнения на архивных снимках (туберкулёз в ЮАР, ретинопатия в Индии) и однодневный эксперимент P&G не показывают, что ИИ внедрён в работу организации.

Раскрытие в отчётности публичных компаний не дало ни одного засчитанного случая. Все 10 компаний направления W8-DISCLOSURE остались на уровне C. Аудированная отчётность подтверждает выручку и расходы, но не вклад ИИ. Аналитики и СМИ чаще всего пересказывают заявления менеджмента.

Лучшие источники — рандомизированные исследования в реальной работе и закрытия под надзором регулятора. Из 20 засчитанных 5 опираются на научное измерение: MASAI, Бриньолфссон, Copilot в Microsoft и Accenture, ИИ-скрайбы. Ещё 15 — неуспехи, установленные регулятором, судом, закрытием или независимой редакцией. Успехи с независимым измерением редки: их 2 из 20.

Волна A почти исчерпана как источник. Из 149 корпоративных кандидатов засчитано 9 (6%); 57 кандидатов, разобранных в этой сессии, добавили 2. Корпоративная история остаётся самоотчётом, даже если её пересказали десять изданий. Показательные примеры: у Rakuten три разные цифры роста среднего чека в публикациях самой компании; «90%» у bp оказалось цифрой из пресс-релиза 2019 года о другой платформе.

Ограничения среза

  • Поиск поздних событий в пакетах продолжения был ограничен бюджетом: 4–20 поисков на пакет. Часть поздних событий (аннулирование штрафа OpenAI, отмена урегулирования Clearview, признание CEO Amazon) нашли проверяющие, а не исполнители.
  • 12 пакетов волны A (86 случаев) без предложений в 120 независимо не перепроверялись. Их итог — оценка исполнителя; в 120 они не входят.
  • 9 случаев отправлены на доработку: Allegheny, UnitedHealth nH Predict, Magalu, «ЕвроХим», «Технологии Доверия», Shougang, Jiyue, INSEAD и эксперимент в доставке еды. Amazon закрыт решением координатора ещё в v0.3.
  • Направления W7 и W8 выполнены впервые и не исчерпаны: производство, розница и сельское хозяйство в W8-FIELD-OPS не набрали кандидатов, Африка и Латинская Америка в W7 почти не охвачены.
  • Цитаты исполнителей нередко оказывались пересказом (например, фраза Money Times у Magalu). Дословными считать только цитаты, которые подтвердил проверяющий.
  • Исполнители — Claude Sonnet, проверяющие — Claude Opus, у каждого отдельный контекст. Независимость здесь означает, что проверяющий сам читал источники, а не независимость людей.
  • Процессный инцидент: исполнитель W7-EU-OTHER сообщил, что его черновой файл в общем временном каталоге перезаписал параллельный процесс. Координатор сверил все файлы пакетов, повреждений нет. Следующим исполнителям черновики разрешены только в папке своего пакета.

Решение для владельца

Порог 120 не снижен. В новых направлениях W7/W8 засчитан примерно каждый пятый случай (11 из 60 разных новых). Чтобы закрыть оставшиеся 100, нужно ещё около 500 новых случаев, то есть примерно 50 пакетов и порядка 1 500 поисков — восемь сессий с нынешним лимитом. Это HYPOTHESIS: выход, скорее всего, будет падать, потому что самые заметные случаи уже найдены. Варианты:

  1. Продолжать W7/W8 до 120. Нужно поднять CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION или выделить несколько сессий. Приоритет — незакрытые направления: производство и ритейл, Азия, Латинская Америка и Африка, русскоязычные и китайские регуляторы и суды. Туда же — 9 доработок и выборочная волна B.
  2. Переопределить цель. Например, «120 случаев с установленным уровнем A–D и исходом» плюс отдельное ядро из 20–40 случаев A/B, проверенных независимо. Это решение владельца, самостоятельно порог не меняется.
  3. Остановиться на v0.4 и перейти к синтезу (E5) на 20 засчитанных случаях и уроках проверки. E5 пока не поручен.

Где что лежит

Реестр 01 Реестры/v0.4/e4_verdicts.jsonl и manifest.json — новая версия; v0.3 и v0.2 не изменены. Пакеты, задания, решения координатора и скрипты — в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены.