AI Native
Историческая редакцияСохранена для понимания развития проекта.
Исследования

AI-native — проверка исходов E4, срез v0.5

Независимую проверку выдержали 42 случая из 120 (в v0.4 было 20). Новые 22 случая почти целиком пришли из двух источников: клинических исследований ИИ в реальной работе больниц (10) и полевых экспериментов в организациях (6). Среди 42…

Заголовок источника

Что выдержало независимую проверку — срез v0.5

О статусе материала

review

Независимую проверку выдержали 42 случая из 120 (в v0.4 было 20). Новые 22 случая почти целиком пришли из двух источников: клинических исследований ИИ в реальной работе больниц (10) и полевых экспериментов в организациях (6). Среди 42 засчитанных 20 неуспехов, 13 смешанных исходов и 9 успехов; уровень A — 4, B — 38. Это промежуточный срез по правилу «примерно каждые 20 засчитанных». Работа продолжается: к моменту среза 6 исследовательских пакетов и 1 проверка ещё идут. По нынешнему выходу поискового бюджета сессии хватит примерно до 65–75 случаев, а не до 120 (см. «Прогноз и решение для владельца»).

Срез продолжает v0.4 по решению владельца от 23.09.2026 (вариант 1: продолжать W7/W8 до 120; лимит WebSearch поднят до 2000 на сессию). Основание — план v0.7 — E4. Все 401 вердикт с замечаниями проверяющих — в таблице вердиктов v0.5.

План, факт, пробел

Показатель План v0.4 v0.5 Пробел
Проверенные случаи A/B с установленным исходом ≥ 120 20 42 (A — 4, B — 38) 78
Из них неуспешные и смешанные ≥ 30 18 33 (20 + 13) выполнено
Независимая перепроверка кандидатов в 120 все все все —
Независимая перепроверка остальных ≥ 25% в каждом пакете 12 пакетов A без перепроверки все 21 пакет A перепроверены (≥ 25%); проверены все завершённые пакеты W7/W8, кроме одного, ещё идущего —
Разбор волны A 149 149 149 —
Волна B выборочно 0 16 из 161 (2 пакета) остальные не берутся — см. ниже
Доработки needs_rework 9 0 10 из 10 (с Samsung) —
Россия / Китай / США / другие страны среди засчитанных покрытие всех 0 / 1 / 11 / 8 0 / 5 / 18 / 19 Россия

Всего 401 вердикт, 321 из них — независимого проверяющего. Дубли параллельных пакетов и повторные находки кандидатов волн A/B засчитаны не больше одного раза (записи duplicate_of в 02 Рабочие материалы/e4-v07/adjudications.json).

Засчитанные случаи — новые в v0.5 (22)

Случай Уровень, исход Почему засчитан Оговорка
UCLA Health, РКИ ИИ-скрайбов DAX и Nabla A, смешанный Трёхрукавное РКИ в рутинной практике: 238 врачей, около 72 000 визитов, 11.2024–01.2025; Nabla значимо сократила время записей, DAX — нет (−1,7%, p=0,66) Масштабирование после РКИ не найдено
Penda Health (Кения), ИИ-консультант клиницистов A, смешанный Независимое РКИ (KEMRI-Wellcome, LSHTM; Nature Medicine, 06.2026): «лечебная неудача» 2,2% против 2,0%, OR 0,77, незначимо — заявленный компанией и OpenAI успех по главному исходу не подтвердился 3 из 15 соавторов — сотрудники Penda, двое с опционами
GOLDEN BRIDGE II (Китай, 77 больниц), ИИ-поддержка решений при инсульте B, успех Кластерное РКИ, BMJ 2026: новые сосудистые события 2,9% против 3,9% за 3 месяца, aHR 0,74 Систему разработали сами исследователи; инвалидизация и смертность не различаются
Brainomix 360 Stroke в NHS Англии B, успех Lancet Digital Health 2025, национальный аудит SSNAP с контрольными больницами: доля тромбэктомий 2,3% → 4,6% против 1,6% → 2,6% 3 соавтора — сотрудники Brainomix
NHS DERM (Skin Analytics), сортировка рака кожи B, смешанный Независимая оценка Unity Insights/University of Surrey по заказу DHSC на 4 площадках: чувствительность к меланоме > 90% Открыта только 4-страничная сводка; экономия смоделирована
Harris Health (Хьюстон), сепсис-алерт Epic B, неуспех JAMIA 2026 (PMID 41293980): после перехода с правила SIRS на алерт Epic время до антибиотиков, посевов, ОРИТ и смертность не изменились Засчитано по статье об исходах, найденной проверяющим; статья автора — точность модели
UVA Health, кластерное РКИ раннего предупреждения B, неуспех Sci Rep 2026, 10 422 госпитализации: «no change in the primary outcome» Авторы — разработчики модели, один работает у вендора
ZAS (Антверпен), ИИ в патоморфологии простаты B, успех Число иммуногистохимических срезов на случай −26% (p < 0,001) До/после без контроля; эффект по сроку выполнения в пределах колебаний
Hallym Dongtan (Корея), ИИ при колоноскопии B, успех Параллельный контроль по залам и PSM 474/474: выявление аденом 35,9% против 26,4% Соавтор — сотрудник вендора INFINITT, в статье «no competing interests»
Albert (DINUM), ИИ-помощник консультантов France Services B, неуспех Официальное решение не распространять (09.01.2026) и признание кабинета министра «Albert n'a pas très bien fonctionné» Официальной оценки с измерениями нет
Allegheny County (Пенсильвания), модель AFST в приёме обращений B, смешанный Оценки Стэнфорда и Rittenhouse et al.: сокращение расового разрыва в части решений; падение открытых дел AFST не приписано Оба анализа — на административных данных округа (B «на пределе»)
Колорадо, агентство защиты детей: ML-поддержка решений B, успех Предрегистрированное РКИ, 4 681 ребёнок: индекс вреда значимо снизился (p = 0,046) Госпитализации −21% незначимо (p = 0,068); РКИ 2020–2022, засчитано по правилу окна (публикация 2025)
Ant Group, внутренняя LLM CodeFuse B, успех Квазиэксперимент BIS (PSM + DiD): рост выработки кода; после пилота инструмент выдан всем Один из четырёх авторов — сотрудник Ant; данные компании
Alibaba/Taobao, ИИ-ассистент в послепродажном чате B, смешанный РКИ на 5 940 новых операторах: диагностика −8,2%, недовольство −3,4% Эксперимент провела Alibaba; 2 из 6 авторов — из компании
Alibaba/Taobao, автономный ИИ-агент поддержки B, смешанный РКИ на 647 операторах, 680 676 чатов: длительность −16,8%, рейтинг клиентов −0,41 балла Общее происхождение с предыдущим случаем — засчитаны раздельно
PSG Global Solutions, голосовой ИИ на собеседованиях B, успех Естественный эксперимент, 70 884 заявки: офферы +12%, выход на работу +18%, удержание +18% 7% ИИ-интервью прервались из-за сбоя; соавтор позже стал неоплачиваемым экономистом PSG
NAV IT (Норвегия), GitHub Copilot у разработчиков госагентства B, неуспех Внешние авторы (UiO, SINTEF), рецензия HICSS-59: по данным репозиториев NAV и опросу значимого эффекта Copilot нет Выборка 39 разработчиков
CNET, ИИ-статьи CNET Money B, неуспех Поправки в 41 из 77 статей; программа приостановлена Число 41/77 — из колонки самой редакции
Samsung Electronics, генеративный ИИ в подразделении DS B, неуспех За ~20 дней после разрешения ChatGPT — минимум 3 утечки, затем ограничения (Economist Korea и Bloomberg — разное происхождение) Полного трёхлетнего запрета не было; в 2026 доступ снова расширен
Bunnings, распознавание лиц в магазинах B, смешанный OAIC (11.2024) и трибунал ART (02.2026): нарушение закона о приватности; апелляции не будет Эффективность против краж не измерена
Foodstuffs North Island (Новая Зеландия), распознавание лиц B, смешанный Заключение Уполномоченного по приватности: пилот в целом законен, серьёзных инцидентов около −16%, но 9 ошибочных совпадений и требования доработок Цифру снижения посчитала нанятая аналитическая фирма
Adelphi University, ИИ-детектор Turnitin в дисциплинарном процессе B, неуспех Суд округа Нассау (28.01.2026) аннулировал взыскание, основанное только на оценке Turnitin Единичное дело, процедурные основания (засчитано по прецеденту Air Canada)

Засчитанные ранее 20 случаев — в v0.4.

Решения координатора в этом срезе

Все решения записаны в adjudications.json; research.json и verify.json не менялись.

  • Прецедент соавторов из компании. Полевой эксперимент в реальной работе, где большинство авторов внешние, а меньшинство работает в компании и даёт данные, засчитывается как B без второго источника, если ИИ потом внедрён. Так было с Microsoft и Accenture в v0.4; теперь так же Ant Group и оба случая Alibaba. При строгом прочтении плана v0.4 (раздел 7) эти 5 случаев были бы C.
  • Правило окна по дате установления исхода (не утверждено владельцем) теперь затрагивает четыре засчитанных случая: Rite Aid, Детройт, Бриньолфссон и Колорадо. ShotSpotter (Чикаго) исключён: отчёт инспектора вышел в 2021 году.
  • Единица наблюдения. Засчитывается организация, которая сама внедрила ИИ: одна или ограниченная идентифицируемая группа. Исследования рынка труда по тысячам фирм (Дания) и шок от выхода ChatGPT для фрилансеров — контекст для синтеза, не 120.
  • AI-native компании. Засчитывается исход работы, которую выполняет сам ИИ (Cruise). Рыночный провал потребительского ИИ-продукта (Humane, Rabbit, Tome), сделки (Inflection), IP-споры (Stability) и показатели проспектов (MiniMax, Zhipu) — нет.
  • «Алгоритм» ≠ ИИ. Earnest (санкция $2,5 млн за правило отсечения) и Cigna PxDx не засчитаны, как Robodebt.
  • Дубли с ранее засчитанными. Deloitte/DEWR, NYC MyCity, Cruise, Bunnings и Builder.ai нашлись повторно; засчитаны один раз.

Что показала проверка

Выход по направлениям резко различается. Из 20 проверенных новых пакетов засчитанные случаи дали 9:

Направление Пакетов Засчитано
Медицина в реальной работе (W8-FIELD-OPS-4, -5) 2 10
Полевые эксперименты в организациях (W8-FIELD-WORK-2, -3, -4) 3 6
Решения регуляторов и судов вне РФ/КНР (W8-REG-LEGAL-3, -4) 2 2
Неуспехи компаний (W7-EU-OTHER-2, W7-US-2) 2 3
Раскрытия в отчётности, суды РФ/КНР, производство, ритейл и агро, неуспехи РФ/КНР, США и Европы, AI-native, рынок труда, волна B 11 0

Почему не проходят предложения исполнителей. Исполнители предложили в 120 около 105 случаев, проверку прошли 20. Причины повторяют v0.4 и добавились новые:

  • Один эпизод и одно происхождение. Медийные и сервисные инциденты (Virgin Money, MSN, G/O Media, LA Times, Politiken) держатся на пересказе одного поста или одной статьи. Программы после них, как правило, не сворачивают.
  • Инцидент с продуктом или правовой спор вместо изменения работы. Китайские иски об авторском праве на ИИ-изображения, X/Grok, Replika, Stability v Getty, Character.AI.
  • AI washing и мошенничество. Builder.ai, eFishery, Nate, Evolv, Pieces: исход связан с ложными заявлениями о продукте, а не с работой, которую выполнял ИИ.
  • Внешний шок вместо внедрения. Stack Overflow: сама компания ИИ в процесс не внедряла, падение активности — следствие выхода ChatGPT.
  • Точность модели вместо исхода работы. Ретроспективная валидация сепсис-модели, прогон архивных снимков (Ичан), прогнозы экономии (Bosch, Zalando).
  • Численность штата вместо исхода. Все 12 компаний W8-DISCLOSURE-2 (TCS, Сбербанк, BT, Itaú и др.): объявленные сокращения, роль ИИ не установлена или отвергнута самой компанией (CEO TCS: «This is not because of AI»).
  • Эксперимент на сотрудниках, а не изменение их работы. Нацбанк Словакии (задания придуманы исследователями), Siemens в Цуге (35 минут на отобранных снимках).

Россия по-прежнему без засчитанных случаев. Три пакета продолжения по России и Китаю дали 0: судебные споры о продуктах, самоотчёты компаний, ООО «ЦСС» (текст определения суда закрыт капчей, роль ИИ — условная формулировка суда). Китайские случаи в 120 пришли не из W7/W8-RU-CN, а из научных публикаций (Ant, Alibaba, GOLDEN BRIDGE II) и v0.4 (Apollo Go).

Ограничения среза

  • Засчитанные медицинские и полевые исследования часто имеют соавторов из вендора или компании; это раскрыто по каждому случаю. Уровень B у пяти полевых экспериментов держится на прецеденте координатора (см. выше).
  • 80 из 401 вердикта — только оценка исполнителя (пакеты без предложений в 120 проверены выборочно, ≥ 25%). В 120 они не входят.
  • Цитаты исполнителей часто оказывались пересказом или склейкой; проверяющие это исправляли для засчитанных случаев. Дословными считать только цитаты, подтверждённые проверяющим.
  • Исполнители — Claude Sonnet, проверяющие — Claude Opus, у каждого отдельный контекст. Независимость означает, что проверяющий сам читал источники.
  • Процессные нарушения: несколько исполнителей держали черновики в /tmp или scratchpad сессии вопреки заданию (повреждений файлов нет); один проверяющий временно записал verify.json в общую папку packets/ и сам перенёс. Инцидент с данными: один проверяющий при проверке доступности 9 URL передал e-mail владельца в заголовке User-Agent запросов к внешним сайтам (Pragmatic Engineer, CFO.com, SEC, CBS, TechCrunch ×2, MLQ, The Register, Yahoo). После этого во все задания добавлен запрет передавать данные пользователя, правило разослано всем работающим агентам. Отменить уже отправленные запросы нельзя.

Прогноз и решение для владельца

Порог 120 и уровни A–D не снижены. В сессии израсходовано около 690 из 2000 поисков: 21 исследовательский пакет (≈ 30 поисков), 2 доработки и около 25 проверок (≈ 5 поисков). На один завершённый и проверенный новый пакет пришёлся примерно один засчитанный случай. На оставшиеся ~1 300 поисков можно провести ещё около 30 пакетов с проверками. При нынешнем выходе это даст 25–35 случаев, итог — примерно 65–75 из 120. Это HYPOTHESIS: выход в медицине и полевых экспериментах может снижаться по мере исчерпания заметных публикаций.

Координатор продолжает работу по варианту 1, сосредоточив пакеты на медицине и полевых экспериментах. Решения владельца нужны по трём вопросам:

  1. Бюджет для 120. Чтобы добрать оставшиеся ~45 случаев после этой сессии, нужно ещё около 1 800 поисков — вторая сессия с тем же лимитом. Либо принять, что E4 закончится на 65–75 случаях, и перейти к синтезу.
  2. Правило окна по дате установления исхода (4 засчитанных случая от него зависят) — подтвердить или заменить окном по дате внедрения.
  3. Прецедент соавторов из компании (5 засчитанных случаев) — подтвердить или применить строгое правило «нужен второй независимый источник».

Где что лежит

Реестр 01 Реестры/v0.5/e4_verdicts.jsonl и manifest.json — новая версия; v0.4, v0.3 и v0.2 не изменены. Пакеты, задания, решения координатора, учёт поиска (search-ledger.json) и скрипты — в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены.