AI Native
Исследования

AI-native — проверка исходов E4, итоговый срез v0.9

Независимую проверку выдержали 125 случаев изменения работы организаций под влиянием ИИ (цель — 120). Среди них 52 неуспеха, 32 смешанных исхода и 41 успех; уровень A — 29, B — 96. Порог и определения уровней A–D не снижались. Все 125…

Заголовок источника

Порог 120 достигнут: 125 случаев с независимо проверенным исходом — срез v0.9

О статусе материала

review

Независимую проверку выдержали 125 случаев изменения работы организаций под влиянием ИИ (цель — 120). Среди них 52 неуспеха, 32 смешанных исхода и 41 успех; уровень A — 29, B — 96. Порог и определения уровней A–D не снижались. Все 125 прошли независимого проверяющего; дубли засчитаны один раз. Это итоговый срез этапа E4 в этой сессии; активных исполнителей нет.

Главная оговорка: 19 из 125 случаев держатся на трёх правилах координатора, которые владелец ещё не подтвердил (окно по дате установления исхода — 6, соавторы из компании — 5, исторический контроль в медицине — 8). Если отвергнуть все три, в зачёте останется около 106 (см. «Решения для владельца»).

Предыдущие срезы: v0.8, v0.7, v0.6, v0.5, v0.4. Все 677 вердиктов с замечаниями проверяющих и ключевыми источниками — в таблице вердиктов v0.9. Основание — план v0.7 — E4 и решение владельца от 23.09.2026 (вариант 1).

План, факт, пробел

Показатель План v0.4 v0.9 Пробел
Проверенные случаи A/B с установленным исходом ≥ 120 20 125 (A — 29, B — 96) выполнено (с оговоркой о правилах)
Из них неуспешные и смешанные ≥ 30 18 84 (52 + 32) выполнено
Независимая перепроверка кандидатов в 120 все все все —
Независимая перепроверка остальных ≥ 25% в каждом пакете 12 пакетов A без перепроверки все 84 завершённых пакета проверены —
Разбор волны A 149 149 149 —
Волна B выборочно 0 16 (дали 0) остальные 145 не разбирались
Доработки needs_rework 9 — 10 закрыты —
США / Китай / Россия / другие страны покрытие всех 11 / 1 / 0 / 8 38 / 8 / 0 / 79 Россия — 0

Всего 677 вердиктов, 568 из них — независимого проверяющего. Израсходовано 1 566 из 2000 поисков WebSearch сессии; с середины сессии исполнители и проверяющие работали в основном через открытые Europe PMC и PubMed, это лимит не расходует.

Откуда пришли 125 случаев

Направление Засчитано
Медицина и госуслуги в реальной работе (W8-FIELD-OPS) 77
Полевые эксперименты в компаниях, школах, университетах (W8-FIELD-WORK) 14
Решения регуляторов и судов о процессах организаций (W8-REG-LEGAL) 13
Неуспехи компаний и организаций (W7) 12
Волна A (корпоративные кандидаты из обзора источников) 9

По категориям: изменение процесса организации — 118, агентное взаимодействие — 6, AI-native компания — 1 (Cruise).

Новые в v0.9 (23)

Случай Уровень, исход Суть
Geisinger, ML-отбор на колоноскопию B, успех Регрессионный разрыв: +6,9 п.п. пройденных колоноскопий за 6 месяцев
Kaiser Permanente NorCal, причинная ML-модель Transitions B, неуспех Все три первичные точки незначимы
Waitakere (Новая Зеландия), ИИ при колоноскопии B, смешанный РКИ в рутине; финансирование Olympus
Sheikh Shakhbout (Абу-Даби), GI Genius B, успех Реальное применение ИИ-детекции полипов
Ichilov (Тель-Авив), ИИ-детекция переломов B, успех Приёмное отделение
University of Saskatchewan, РКИ ИИ-скрайба B, смешанный Рост эффективности, но ошибок 19 против 9
Singapore General Hospital, aiTriage B, успех Пилотное РКИ в приёмном отделении
MatrixCare (94 дома престарелых PruittHealth) B, успех Разность разностей; 6 из 9 авторов — вендор
ACCESS (Johns Hopkins), автономный ИИ-скрининг ретинопатии у детей B, успех РКИ: скрининг 100% против 22%
NaIA-RD (Наварра), ИИ-скрининг ретинопатии B, смешанный Решения врачей точнее у 3 из 4
Netherlands Cancer Institute, Aidoc — ТЭЛА A, успех Независимые авторы, исторический контроль
UAB, ИИ-триаж внутричерепных кровоизлияний B, неуспех Ни точность, ни сроки не улучшились
NIHR RSET / Nuffield Trust, AI Diagnostic Fund (NHS) B, смешанный Против трастов без ИИ: разницы в заключениях за 24 ч нет
Vall d'Hebron, Methinks (CATalyze-AI) B, неуспех Первичная точка не достигнута; совладелец вендора — соавтор
Sahlgrenska (Швеция), Brainomix 360 Stroke B, успех До/после без конфликта; первичные точки достигнуты
Cooper / Inspira, Viz LVO B, успех Сеть инсультной помощи
MADLAD (Швеция), ИИ-приоритизация вызовов скорой B, успех РКИ в двух диспетчерских: первичная точка достигнута (p = 0,047)
Mayo Clinic, прогноз госпитализации из приёмного отделения B, смешанный Первичная точка не изменилась, вторичная — да
VA REACH VET, прогноз риска суицида B, неуспех Нет эффекта на смертность (оценка 2025)
Mass General Brigham, ИИ-скрайбы в психиатрической документации A, смешанный Больше документирования, меньше вмешательств (в основном коды)
HealthPartners, ML-поддержка скрининга суицид-риска B, неуспех Кластерное РКИ, p = 0,70
NYU Langone, PACE-AI — автоконтуринг B, успех Время сократилось; вклад ИИ — около 4 минут из пакета изменений
Fudan / Шанхай, iNCDSS — дозирование инсулина B, успех РКИ non-inferiority в отделениях; оценщики — разработчики

Что показала проверка (итог E4)

  1. Исход, измеренный кем-то кроме компании, почти всегда находится в трёх местах: клинические исследования в реальной работе больниц, полевые эксперименты исследователей в организациях и решения регуляторов и судов. Корпоративная история — даже пересказанная десятью изданиями, в отчётности или в пресс-релизе — остаётся самоотчётом (волна A дала 9 из 149, волна B — 0 из 16, раскрытия в отчётности — 0 из 22).
  2. Неуспехов больше, чем успехов (52 против 41), когда исход измеряют независимо и по заранее заявленной точке. Частые картины: нулевой эффект на главную точку при положительных вторичных (колоноскопия, TRICORDER, PROTEUS, Mayo), рост процесса без изменения клинических исходов (HPI, REACH VET), расхождение пресс-релиза вендора и первичного результата (TRICORDER, Penda, Oxevision), признание незаконности процесса регулятором (FRT, автоматические деактивации).
  3. Причины отказа повторялись: роль ИИ не установлена или это правила, а не ML; точность модели вместо исхода работы; одно происхождение данных; объявленное решение вместо измерения; индивидуальное использование сотрудником вместо внедрения организацией; инцидент с продуктом вместо изменения работы; оценщик совпадает с внедряющим ведомством.
  4. Корпус смещён в медицину (77 из 125): это область, где исход измеряют чаще всего, а не где ИИ чаще всего меняет работу. Для синтеза (E5) это ключевое ограничение репрезентативности.

Ограничения

  • Россия — 0 засчитанных случаев (единственный кандидат с внешними данными — НМИЦ им. Алмазова — оказался мониторингом точности модели). Китай — 8, в основном научные публикации.
  • Уровень B у значительной части медицинских и полевых случаев держится на исследованиях с разработчиками или вендорами в соавторах при наличии контроля; это раскрыто по каждому случаю в таблице вердиктов.
  • 109 из 677 вердиктов — только оценка исполнителя (пакеты проверены выборочно, ≥ 25%); в 120 они не входят.
  • Исполнители — Claude Sonnet, проверяющие — Claude Opus, у каждого отдельный контекст. Независимость означает, что проверяющий сам открывал источники.
  • Процессные нарушения исполнителей: черновики в /tmp и scratchpad (повреждений нет), один обход капчи PMC сменой User-Agent (после — запрет во всех заданиях), один инцидент с передачей e-mail владельца в заголовке 9 внешних запросов (после — запрет во всех заданиях). Засчитанные случаи на обходе доступа не держатся: их источники проверяющие открывали сами.
  • Часть решений регуляторов и судов не окончательна (Uber/AP, Foodinho, Парана, Met Police LFR).

Решения для владельца

Порог достигнут с запасом 5, но 19 случаев зависят от правил, которые принял координатор:

Правило Случаи Если отвергнуть
Окно 2023–2026 по дате установления исхода (публикации измерения, решения), а не внедрения Rite Aid, Детройт, Бриньолфссон, Колорадо, Canadian Tire, NTUH (HPI) — 6 −6
Полевой эксперимент с меньшинством соавторов из компании — B без второго источника Microsoft, Accenture, Ant Group, Alibaba ×2 — 5 −5
Исторический контроль в медицине при отсутствии конфликта интересов и измеренной первичной точке ZAS, Австралия, Польша, Норвегия, NKI, Halland, Brainomix Sahlgrenska, NaIA-RD — 8 −8

Все три отвергнуты — около 106 (HYPOTHESIS: при строгом правиле часть случаев могла бы получить второй источник). Варианты: (1) подтвердить правила и принять E4 с 125; (2) отвергнуть часть и поручить добор (осталось около 430 поисков лимита этой сессии; Europe PMC лимит не расходует); (3) перейти к синтезу E5 на текущем корпусе с раскрытием чувствительности. E5 пока не поручен.

Где что лежит

Реестр 01 Реестры/v0.9/e4_verdicts.jsonl и manifest.json — новая версия; v0.8 и ранее не изменены. Пакеты, задания, решения координатора (adjudications.json), учёт поиска (search-ledger.json) и скрипты — в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены; публикации и отправки нет.

Продолжить изучение

Приложения и редакции