AI-native — проверка исходов E4, итоговый срез v0.9
Независимую проверку выдержали 125 случаев изменения работы организаций под влиянием ИИ (цель — 120). Среди них 52 неуспеха, 32 смешанных исхода и 41 успех; уровень A — 29, B — 96. Порог и определения уровней A–D не снижались. Все 125…
Заголовок источника
Порог 120 достигнут: 125 случаев с независимо проверенным исходом — срез v0.9
О статусе материала
review
Независимую проверку выдержали 125 случаев изменения работы организаций под влиянием ИИ (цель — 120). Среди них 52 неуспеха, 32 смешанных исхода и 41 успех; уровень A — 29, B — 96. Порог и определения уровней A–D не снижались. Все 125 прошли независимого проверяющего; дубли засчитаны один раз. Это итоговый срез этапа E4 в этой сессии; активных исполнителей нет.
Главная оговорка: 19 из 125 случаев держатся на трёх правилах координатора, которые владелец ещё не подтвердил (окно по дате установления исхода — 6, соавторы из компании — 5, исторический контроль в медицине — 8). Если отвергнуть все три, в зачёте останется около 106 (см. «Решения для владельца»).
Предыдущие срезы: v0.8, v0.7, v0.6, v0.5, v0.4. Все 677 вердиктов с замечаниями проверяющих и ключевыми источниками — в таблице вердиктов v0.9. Основание — план v0.7 — E4 и решение владельца от 23.09.2026 (вариант 1).
План, факт, пробел
| Показатель | План | v0.4 | v0.9 | Пробел |
|---|---|---|---|---|
| Проверенные случаи A/B с установленным исходом | ≥ 120 | 20 | 125 (A — 29, B — 96) | выполнено (с оговоркой о правилах) |
| Из них неуспешные и смешанные | ≥ 30 | 18 | 84 (52 + 32) | выполнено |
| Независимая перепроверка кандидатов в 120 | все | все | все | — |
| Независимая перепроверка остальных | ≥ 25% в каждом пакете | 12 пакетов A без перепроверки | все 84 завершённых пакета проверены | — |
| Разбор волны A | 149 | 149 | 149 | — |
| Волна B | выборочно | 0 | 16 (дали 0) | остальные 145 не разбирались |
| Доработки needs_rework | 9 | — | 10 закрыты | — |
| США / Китай / Россия / другие страны | покрытие всех | 11 / 1 / 0 / 8 | 38 / 8 / 0 / 79 | Россия — 0 |
Всего 677 вердиктов, 568 из них — независимого проверяющего. Израсходовано 1 566 из 2000 поисков WebSearch сессии; с середины сессии исполнители и проверяющие работали в основном через открытые Europe PMC и PubMed, это лимит не расходует.
Откуда пришли 125 случаев
| Направление | Засчитано |
|---|---|
| Медицина и госуслуги в реальной работе (W8-FIELD-OPS) | 77 |
| Полевые эксперименты в компаниях, школах, университетах (W8-FIELD-WORK) | 14 |
| Решения регуляторов и судов о процессах организаций (W8-REG-LEGAL) | 13 |
| Неуспехи компаний и организаций (W7) | 12 |
| Волна A (корпоративные кандидаты из обзора источников) | 9 |
По категориям: изменение процесса организации — 118, агентное взаимодействие — 6, AI-native компания — 1 (Cruise).
Новые в v0.9 (23)
| Случай | Уровень, исход | Суть |
|---|---|---|
| Geisinger, ML-отбор на колоноскопию | B, успех | Регрессионный разрыв: +6,9 п.п. пройденных колоноскопий за 6 месяцев |
| Kaiser Permanente NorCal, причинная ML-модель Transitions | B, неуспех | Все три первичные точки незначимы |
| Waitakere (Новая Зеландия), ИИ при колоноскопии | B, смешанный | РКИ в рутине; финансирование Olympus |
| Sheikh Shakhbout (Абу-Даби), GI Genius | B, успех | Реальное применение ИИ-детекции полипов |
| Ichilov (Тель-Авив), ИИ-детекция переломов | B, успех | Приёмное отделение |
| University of Saskatchewan, РКИ ИИ-скрайба | B, смешанный | Рост эффективности, но ошибок 19 против 9 |
| Singapore General Hospital, aiTriage | B, успех | Пилотное РКИ в приёмном отделении |
| MatrixCare (94 дома престарелых PruittHealth) | B, успех | Разность разностей; 6 из 9 авторов — вендор |
| ACCESS (Johns Hopkins), автономный ИИ-скрининг ретинопатии у детей | B, успех | РКИ: скрининг 100% против 22% |
| NaIA-RD (Наварра), ИИ-скрининг ретинопатии | B, смешанный | Решения врачей точнее у 3 из 4 |
| Netherlands Cancer Institute, Aidoc — ТЭЛА | A, успех | Независимые авторы, исторический контроль |
| UAB, ИИ-триаж внутричерепных кровоизлияний | B, неуспех | Ни точность, ни сроки не улучшились |
| NIHR RSET / Nuffield Trust, AI Diagnostic Fund (NHS) | B, смешанный | Против трастов без ИИ: разницы в заключениях за 24 ч нет |
| Vall d'Hebron, Methinks (CATalyze-AI) | B, неуспех | Первичная точка не достигнута; совладелец вендора — соавтор |
| Sahlgrenska (Швеция), Brainomix 360 Stroke | B, успех | До/после без конфликта; первичные точки достигнуты |
| Cooper / Inspira, Viz LVO | B, успех | Сеть инсультной помощи |
| MADLAD (Швеция), ИИ-приоритизация вызовов скорой | B, успех | РКИ в двух диспетчерских: первичная точка достигнута (p = 0,047) |
| Mayo Clinic, прогноз госпитализации из приёмного отделения | B, смешанный | Первичная точка не изменилась, вторичная — да |
| VA REACH VET, прогноз риска суицида | B, неуспех | Нет эффекта на смертность (оценка 2025) |
| Mass General Brigham, ИИ-скрайбы в психиатрической документации | A, смешанный | Больше документирования, меньше вмешательств (в основном коды) |
| HealthPartners, ML-поддержка скрининга суицид-риска | B, неуспех | Кластерное РКИ, p = 0,70 |
| NYU Langone, PACE-AI — автоконтуринг | B, успех | Время сократилось; вклад ИИ — около 4 минут из пакета изменений |
| Fudan / Шанхай, iNCDSS — дозирование инсулина | B, успех | РКИ non-inferiority в отделениях; оценщики — разработчики |
Что показала проверка (итог E4)
- Исход, измеренный кем-то кроме компании, почти всегда находится в трёх местах: клинические исследования в реальной работе больниц, полевые эксперименты исследователей в организациях и решения регуляторов и судов. Корпоративная история — даже пересказанная десятью изданиями, в отчётности или в пресс-релизе — остаётся самоотчётом (волна A дала 9 из 149, волна B — 0 из 16, раскрытия в отчётности — 0 из 22).
- Неуспехов больше, чем успехов (52 против 41), когда исход измеряют независимо и по заранее заявленной точке. Частые картины: нулевой эффект на главную точку при положительных вторичных (колоноскопия, TRICORDER, PROTEUS, Mayo), рост процесса без изменения клинических исходов (HPI, REACH VET), расхождение пресс-релиза вендора и первичного результата (TRICORDER, Penda, Oxevision), признание незаконности процесса регулятором (FRT, автоматические деактивации).
- Причины отказа повторялись: роль ИИ не установлена или это правила, а не ML; точность модели вместо исхода работы; одно происхождение данных; объявленное решение вместо измерения; индивидуальное использование сотрудником вместо внедрения организацией; инцидент с продуктом вместо изменения работы; оценщик совпадает с внедряющим ведомством.
- Корпус смещён в медицину (77 из 125): это область, где исход измеряют чаще всего, а не где ИИ чаще всего меняет работу. Для синтеза (E5) это ключевое ограничение репрезентативности.
Ограничения
- Россия — 0 засчитанных случаев (единственный кандидат с внешними данными — НМИЦ им. Алмазова — оказался мониторингом точности модели). Китай — 8, в основном научные публикации.
- Уровень B у значительной части медицинских и полевых случаев держится на исследованиях с разработчиками или вендорами в соавторах при наличии контроля; это раскрыто по каждому случаю в таблице вердиктов.
- 109 из 677 вердиктов — только оценка исполнителя (пакеты проверены выборочно, ≥ 25%); в 120 они не входят.
- Исполнители — Claude Sonnet, проверяющие — Claude Opus, у каждого отдельный контекст. Независимость означает, что проверяющий сам открывал источники.
- Процессные нарушения исполнителей: черновики в
/tmpи scratchpad (повреждений нет), один обход капчи PMC сменой User-Agent (после — запрет во всех заданиях), один инцидент с передачей e-mail владельца в заголовке 9 внешних запросов (после — запрет во всех заданиях). Засчитанные случаи на обходе доступа не держатся: их источники проверяющие открывали сами. - Часть решений регуляторов и судов не окончательна (Uber/AP, Foodinho, Парана, Met Police LFR).
Решения для владельца
Порог достигнут с запасом 5, но 19 случаев зависят от правил, которые принял координатор:
| Правило | Случаи | Если отвергнуть |
|---|---|---|
| Окно 2023–2026 по дате установления исхода (публикации измерения, решения), а не внедрения | Rite Aid, Детройт, Бриньолфссон, Колорадо, Canadian Tire, NTUH (HPI) — 6 | −6 |
| Полевой эксперимент с меньшинством соавторов из компании — B без второго источника | Microsoft, Accenture, Ant Group, Alibaba ×2 — 5 | −5 |
| Исторический контроль в медицине при отсутствии конфликта интересов и измеренной первичной точке | ZAS, Австралия, Польша, Норвегия, NKI, Halland, Brainomix Sahlgrenska, NaIA-RD — 8 | −8 |
Все три отвергнуты — около 106 (HYPOTHESIS: при строгом правиле часть случаев могла бы получить второй источник). Варианты: (1) подтвердить правила и принять E4 с 125; (2) отвергнуть часть и поручить добор (осталось около 430 поисков лимита этой сессии; Europe PMC лимит не расходует); (3) перейти к синтезу E5 на текущем корпусе с раскрытием чувствительности. E5 пока не поручен.
Где что лежит
Реестр 01 Реестры/v0.9/e4_verdicts.jsonl и manifest.json — новая версия; v0.8 и ранее не изменены. Пакеты, задания, решения координатора (adjudications.json), учёт поиска (search-ledger.json) и скрипты — в 02 Рабочие материалы/e4-v07. Результат в review, владелец его не принял. E5–E7 не поручены; публикации и отправки нет.
Продолжить изучение
Приложения и редакции
- Предыдущая редакция: AI-native — проверка исходов E4, промежуточный срез v0.3
- Предыдущая редакция: AI-native — проверка исходов E4, срез v0.4
- Предыдущая редакция: AI-native — проверка исходов E4, срез v0.5
- Предыдущая редакция: AI-native — проверка исходов E4, срез v0.6
- Предыдущая редакция: AI-native — проверка исходов E4, срез v0.7
- Предыдущая редакция: AI-native — проверка исходов E4, срез v0.8