Следующая редакция: AI-native — проверка исходов E4, итоговый срез v0.9 →
AI-native — проверка исходов E4, срез v0.5
Независимую проверку выдержали 42 случая из 120 (в v0.4 было 20). Новые 22 случая почти целиком пришли из двух источников: клинических исследований ИИ в реальной работе больниц (10) и полевых экспериментов в организациях (6). Среди 42…
Заголовок источника
Что выдержало независимую проверку — срез v0.5
О статусе материала
review
Независимую проверку выдержали 42 случая из 120 (в v0.4 было 20). Новые 22 случая почти целиком пришли из двух источников: клинических исследований ИИ в реальной работе больниц (10) и полевых экспериментов в организациях (6). Среди 42 засчитанных 20 неуспехов, 13 смешанных исходов и 9 успехов; уровень A — 4, B — 38. Это промежуточный срез по правилу «примерно каждые 20 засчитанных». Работа продолжается: к моменту среза 6 исследовательских пакетов и 1 проверка ещё идут. По нынешнему выходу поискового бюджета сессии хватит примерно до 65–75 случаев, а не до 120 (см. «Прогноз и решение для владельца»).
Срез продолжает v0.4 по решению владельца от 23.09.2026 (вариант 1: продолжать W7/W8 до 120; лимит WebSearch поднят до 2000 на сессию). Основание — план v0.7 — E4. Все 401 вердикт с замечаниями проверяющих — в таблице вердиктов v0.5.
План, факт, пробел
| Показатель | План | v0.4 | v0.5 | Пробел |
|---|---|---|---|---|
| Проверенные случаи A/B с установленным исходом | ≥ 120 | 20 | 42 (A — 4, B — 38) | 78 |
| Из них неуспешные и смешанные | ≥ 30 | 18 | 33 (20 + 13) | выполнено |
| Независимая перепроверка кандидатов в 120 | все | все | все | — |
| Независимая перепроверка остальных | ≥ 25% в каждом пакете | 12 пакетов A без перепроверки | все 21 пакет A перепроверены (≥ 25%); проверены все завершённые пакеты W7/W8, кроме одного, ещё идущего | — |
| Разбор волны A | 149 | 149 | 149 | — |
| Волна B | выборочно | 0 | 16 из 161 (2 пакета) | остальные не берутся — см. ниже |
| Доработки needs_rework | 9 | 0 | 10 из 10 (с Samsung) | — |
| Россия / Китай / США / другие страны среди засчитанных | покрытие всех | 0 / 1 / 11 / 8 | 0 / 5 / 18 / 19 | Россия |
Всего 401 вердикт, 321 из них — независимого проверяющего. Дубли параллельных пакетов и повторные находки кандидатов волн A/B засчитаны не больше одного раза (записи duplicate_of в 02 Рабочие материалы/e4-v07/adjudications.json).
Засчитанные случаи — новые в v0.5 (22)
| Случай | Уровень, исход | Почему засчитан | Оговорка |
|---|---|---|---|
| UCLA Health, РКИ ИИ-скрайбов DAX и Nabla | A, смешанный | Трёхрукавное РКИ в рутинной практике: 238 врачей, около 72 000 визитов, 11.2024–01.2025; Nabla значимо сократила время записей, DAX — нет (−1,7%, p=0,66) | Масштабирование после РКИ не найдено |
| Penda Health (Кения), ИИ-консультант клиницистов | A, смешанный | Независимое РКИ (KEMRI-Wellcome, LSHTM; Nature Medicine, 06.2026): «лечебная неудача» 2,2% против 2,0%, OR 0,77, незначимо — заявленный компанией и OpenAI успех по главному исходу не подтвердился | 3 из 15 соавторов — сотрудники Penda, двое с опционами |
| GOLDEN BRIDGE II (Китай, 77 больниц), ИИ-поддержка решений при инсульте | B, успех | Кластерное РКИ, BMJ 2026: новые сосудистые события 2,9% против 3,9% за 3 месяца, aHR 0,74 | Систему разработали сами исследователи; инвалидизация и смертность не различаются |
| Brainomix 360 Stroke в NHS Англии | B, успех | Lancet Digital Health 2025, национальный аудит SSNAP с контрольными больницами: доля тромбэктомий 2,3% → 4,6% против 1,6% → 2,6% | 3 соавтора — сотрудники Brainomix |
| NHS DERM (Skin Analytics), сортировка рака кожи | B, смешанный | Независимая оценка Unity Insights/University of Surrey по заказу DHSC на 4 площадках: чувствительность к меланоме > 90% | Открыта только 4-страничная сводка; экономия смоделирована |
| Harris Health (Хьюстон), сепсис-алерт Epic | B, неуспех | JAMIA 2026 (PMID 41293980): после перехода с правила SIRS на алерт Epic время до антибиотиков, посевов, ОРИТ и смертность не изменились | Засчитано по статье об исходах, найденной проверяющим; статья автора — точность модели |
| UVA Health, кластерное РКИ раннего предупреждения | B, неуспех | Sci Rep 2026, 10 422 госпитализации: «no change in the primary outcome» | Авторы — разработчики модели, один работает у вендора |
| ZAS (Антверпен), ИИ в патоморфологии простаты | B, успех | Число иммуногистохимических срезов на случай −26% (p < 0,001) | До/после без контроля; эффект по сроку выполнения в пределах колебаний |
| Hallym Dongtan (Корея), ИИ при колоноскопии | B, успех | Параллельный контроль по залам и PSM 474/474: выявление аденом 35,9% против 26,4% | Соавтор — сотрудник вендора INFINITT, в статье «no competing interests» |
| Albert (DINUM), ИИ-помощник консультантов France Services | B, неуспех | Официальное решение не распространять (09.01.2026) и признание кабинета министра «Albert n'a pas très bien fonctionné» | Официальной оценки с измерениями нет |
| Allegheny County (Пенсильвания), модель AFST в приёме обращений | B, смешанный | Оценки Стэнфорда и Rittenhouse et al.: сокращение расового разрыва в части решений; падение открытых дел AFST не приписано | Оба анализа — на административных данных округа (B «на пределе») |
| Колорадо, агентство защиты детей: ML-поддержка решений | B, успех | Предрегистрированное РКИ, 4 681 ребёнок: индекс вреда значимо снизился (p = 0,046) | Госпитализации −21% незначимо (p = 0,068); РКИ 2020–2022, засчитано по правилу окна (публикация 2025) |
| Ant Group, внутренняя LLM CodeFuse | B, успех | Квазиэксперимент BIS (PSM + DiD): рост выработки кода; после пилота инструмент выдан всем | Один из четырёх авторов — сотрудник Ant; данные компании |
| Alibaba/Taobao, ИИ-ассистент в послепродажном чате | B, смешанный | РКИ на 5 940 новых операторах: диагностика −8,2%, недовольство −3,4% | Эксперимент провела Alibaba; 2 из 6 авторов — из компании |
| Alibaba/Taobao, автономный ИИ-агент поддержки | B, смешанный | РКИ на 647 операторах, 680 676 чатов: длительность −16,8%, рейтинг клиентов −0,41 балла | Общее происхождение с предыдущим случаем — засчитаны раздельно |
| PSG Global Solutions, голосовой ИИ на собеседованиях | B, успех | Естественный эксперимент, 70 884 заявки: офферы +12%, выход на работу +18%, удержание +18% | 7% ИИ-интервью прервались из-за сбоя; соавтор позже стал неоплачиваемым экономистом PSG |
| NAV IT (Норвегия), GitHub Copilot у разработчиков госагентства | B, неуспех | Внешние авторы (UiO, SINTEF), рецензия HICSS-59: по данным репозиториев NAV и опросу значимого эффекта Copilot нет | Выборка 39 разработчиков |
| CNET, ИИ-статьи CNET Money | B, неуспех | Поправки в 41 из 77 статей; программа приостановлена | Число 41/77 — из колонки самой редакции |
| Samsung Electronics, генеративный ИИ в подразделении DS | B, неуспех | За ~20 дней после разрешения ChatGPT — минимум 3 утечки, затем ограничения (Economist Korea и Bloomberg — разное происхождение) | Полного трёхлетнего запрета не было; в 2026 доступ снова расширен |
| Bunnings, распознавание лиц в магазинах | B, смешанный | OAIC (11.2024) и трибунал ART (02.2026): нарушение закона о приватности; апелляции не будет | Эффективность против краж не измерена |
| Foodstuffs North Island (Новая Зеландия), распознавание лиц | B, смешанный | Заключение Уполномоченного по приватности: пилот в целом законен, серьёзных инцидентов около −16%, но 9 ошибочных совпадений и требования доработок | Цифру снижения посчитала нанятая аналитическая фирма |
| Adelphi University, ИИ-детектор Turnitin в дисциплинарном процессе | B, неуспех | Суд округа Нассау (28.01.2026) аннулировал взыскание, основанное только на оценке Turnitin | Единичное дело, процедурные основания (засчитано по прецеденту Air Canada) |
Засчитанные ранее 20 случаев — в v0.4.
Решения координатора в этом срезе
Все решения записаны в adjudications.json; research.json и verify.json не менялись.
- Прецедент соавторов из компании. Полевой эксперимент в реальной работе, где большинство авторов внешние, а меньшинство работает в компании и даёт данные, засчитывается как B без второго источника, если ИИ потом внедрён. Так было с Microsoft и Accenture в v0.4; теперь так же Ant Group и оба случая Alibaba. При строгом прочтении плана v0.4 (раздел 7) эти 5 случаев были бы C.
- Правило окна по дате установления исхода (не утверждено владельцем) теперь затрагивает четыре засчитанных случая: Rite Aid, Детройт, Бриньолфссон и Колорадо. ShotSpotter (Чикаго) исключён: отчёт инспектора вышел в 2021 году.
- Единица наблюдения. Засчитывается организация, которая сама внедрила ИИ: одна или ограниченная идентифицируемая группа. Исследования рынка труда по тысячам фирм (Дания) и шок от выхода ChatGPT для фрилансеров — контекст для синтеза, не 120.
- AI-native компании. Засчитывается исход работы, которую выполняет сам ИИ (Cruise). Рыночный провал потребительского ИИ-продукта (Humane, Rabbit, Tome), сделки (Inflection), IP-споры (Stability) и показатели проспектов (MiniMax, Zhipu) — нет.
- «Алгоритм» ≠ ИИ. Earnest (санкция $2,5 млн за правило отсечения) и Cigna PxDx не засчитаны, как Robodebt.
- Дубли с ранее засчитанными. Deloitte/DEWR, NYC MyCity, Cruise, Bunnings и Builder.ai нашлись повторно; засчитаны один раз.
Что показала проверка
Выход по направлениям резко различается. Из 20 проверенных новых пакетов засчитанные случаи дали 9:
| Направление | Пакетов | Засчитано |
|---|---|---|
| Медицина в реальной работе (W8-FIELD-OPS-4, -5) | 2 | 10 |
| Полевые эксперименты в организациях (W8-FIELD-WORK-2, -3, -4) | 3 | 6 |
| Решения регуляторов и судов вне РФ/КНР (W8-REG-LEGAL-3, -4) | 2 | 2 |
| Неуспехи компаний (W7-EU-OTHER-2, W7-US-2) | 2 | 3 |
| Раскрытия в отчётности, суды РФ/КНР, производство, ритейл и агро, неуспехи РФ/КНР, США и Европы, AI-native, рынок труда, волна B | 11 | 0 |
Почему не проходят предложения исполнителей. Исполнители предложили в 120 около 105 случаев, проверку прошли 20. Причины повторяют v0.4 и добавились новые:
- Один эпизод и одно происхождение. Медийные и сервисные инциденты (Virgin Money, MSN, G/O Media, LA Times, Politiken) держатся на пересказе одного поста или одной статьи. Программы после них, как правило, не сворачивают.
- Инцидент с продуктом или правовой спор вместо изменения работы. Китайские иски об авторском праве на ИИ-изображения, X/Grok, Replika, Stability v Getty, Character.AI.
- AI washing и мошенничество. Builder.ai, eFishery, Nate, Evolv, Pieces: исход связан с ложными заявлениями о продукте, а не с работой, которую выполнял ИИ.
- Внешний шок вместо внедрения. Stack Overflow: сама компания ИИ в процесс не внедряла, падение активности — следствие выхода ChatGPT.
- Точность модели вместо исхода работы. Ретроспективная валидация сепсис-модели, прогон архивных снимков (Ичан), прогнозы экономии (Bosch, Zalando).
- Численность штата вместо исхода. Все 12 компаний W8-DISCLOSURE-2 (TCS, Сбербанк, BT, Itaú и др.): объявленные сокращения, роль ИИ не установлена или отвергнута самой компанией (CEO TCS: «This is not because of AI»).
- Эксперимент на сотрудниках, а не изменение их работы. Нацбанк Словакии (задания придуманы исследователями), Siemens в Цуге (35 минут на отобранных снимках).
Россия по-прежнему без засчитанных случаев. Три пакета продолжения по России и Китаю дали 0: судебные споры о продуктах, самоотчёты компаний, ООО «ЦСС» (текст определения суда закрыт капчей, роль ИИ — условная формулировка суда). Китайские случаи в 120 пришли не из W7/W8-RU-CN, а из научных публикаций (Ant, Alibaba, GOLDEN BRIDGE II) и v0.4 (Apollo Go).
Ограничения среза
- Засчитанные медицинские и полевые исследования часто имеют соавторов из вендора или компании; это раскрыто по каждому случаю. Уровень B у пяти полевых экспериментов держится на прецеденте координатора (см. выше).
- 80 из 401 вердикта — только оценка исполнителя (пакеты без предложений в 120 проверены выборочно, ≥ 25%). В 120 они не входят.
- Цитаты исполнителей часто оказывались пересказом или склейкой; проверяющие это исправляли для засчитанных случаев. Дословными считать только цитаты, подтверждённые проверяющим.
- Исполнители — Claude Sonnet, проверяющие — Claude Opus, у каждого отдельный контекст. Независимость означает, что проверяющий сам читал источники.
- Процессные нарушения: несколько исполнителей держали черновики в
/tmpили scratchpad сессии вопреки заданию (повреждений файлов нет); один проверяющий временно записал verify.json в общую папкуpackets/и сам перенёс. Инцидент с данными: один проверяющий при проверке доступности 9 URL передал e-mail владельца в заголовке User-Agent запросов к внешним сайтам (Pragmatic Engineer, CFO.com, SEC, CBS, TechCrunch ×2, MLQ, The Register, Yahoo). После этого во все задания добавлен запрет передавать данные пользователя, правило разослано всем работающим агентам. Отменить уже отправленные запросы нельзя.
Прогноз и решение для владельца
Порог 120 и уровни A–D не снижены. В сессии израсходовано около 690 из 2000 поисков: 21 исследовательский пакет (≈ 30 поисков), 2 доработки и около 25 проверок (≈ 5 поисков). На один завершённый и проверенный новый пакет пришёлся примерно один засчитанный случай. На оставшиеся ~1 300 поисков можно провести ещё около 30 пакетов с проверками. При нынешнем выходе это даст 25–35 случаев, итог — примерно 65–75 из 120. Это HYPOTHESIS: выход в медицине и полевых экспериментах может снижаться по мере исчерпания заметных публикаций.
Координатор продолжает работу по варианту 1, сосредоточив пакеты на медицине и полевых экспериментах. Решения владельца нужны по трём вопросам:
- Бюджет для 120. Чтобы добрать оставшиеся ~45 случаев после этой сессии, нужно ещё около 1 800 поисков — вторая сессия с тем же лимитом. Либо принять, что E4 закончится на 65–75 случаях, и перейти к синтезу.
- Правило окна по дате установления исхода (4 засчитанных случая от него зависят) — подтвердить или заменить окном по дате внедрения.
- Прецедент соавторов из компании (5 засчитанных случаев) — подтвердить или применить строгое правило «нужен второй независимый источник».
Где что лежит
Реестр 01 Реестры/v0.5/e4_verdicts.jsonl и manifest.json — новая версия; v0.4, v0.3 и v0.2 не изменены. Пакеты, задания, решения координатора, учёт поиска (search-ledger.json) и скрипты — в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены.