Отчёт аудита и карта пробелов
Главное. Факты и числа синтеза прошли независимую проверку: критических ошибок нет, около 20 существенных неточностей исправлены, повторная проверка это подтвердила. Главный вывод держится и без 19 случаев, зависящих от неутверждённых…
Заголовок источника
Отчёт аудита и карта пробелов
О статусе материала
review
Главное. Факты и числа синтеза прошли независимую проверку: критических ошибок нет, около 20 существенных неточностей исправлены, повторная проверка это подтвердила. Главный вывод держится и без 19 случаев, зависящих от неутверждённых правил, но вывод об ухудшении навыков без них не держится. Язык главного обзора — 8,6 из 10; у остальных документов 7,6–8,5, ниже плана (8,5). Владелец 24.09.2026 решил принять текст в этом виде. Самые слабые места знания — Россия (ни одного проверенного случая), промышленность, финансы и ритейл, а также перекос в медицину.
Кто и что проверял
Аудит E6 провели три независимых ИИ-аудитора, не участвовавших в синтезе. Людей-проверяющих не было; «независимость» здесь означает, что аудитор сам открывал первоисточники и пересчитывал числа.
| Часть | Что сделано | Замечаний | Итог |
|---|---|---|---|
| Содержание | 21 случай сверен с первоисточниками, ещё 8 — с карточками; это около половины случаев, названных в обзоре и разборах (план — не меньше четверти). Проверены все финансовые и причинные тезисы | 33 (15 существенных) | 29 закрыты, 4 закрыты частично и дотянуты координатором |
| Техника | Все числа обзора пересчитаны скриптом по кодировке и реестру; карта 125 случаев, заголовки 28 разборов, 343 внешние ссылки (20 открыты) | 24 (6 существенных) | Все существенные закрыты |
| Язык | Независимая оценка ru-score по 14 документам, сквозная согласованность 28 разборов | 84 (34 существенных) | 29 закрыты; оценки — в таблице ниже |
Что было исправлено по существу
| Где | Было | Стало |
|---|---|---|
| Uber, штраф | «около 4% мирового оборота» | около 1,9% оборота 2025 года; 4% — верхний предел по GDPR. Исправлено и в реестре v1.0 |
| Колоноскопия в обзоре | пример того, что «работает» | из 6 испытаний ИИ-детекции полипов успешное одно |
| Epic, сепсис | «смертность не изменилась» | 11% против 8% без поправки; разница исчезает после поправки на COVID |
| Albert, Франция | «закрыли, потому что работал плохо» | точная цитата без причинной связки |
| Deloitte | «несуществующее судебное дело» | выдуманная цитата из реального решения суда |
| Penda Health | «независимое испытание разницы не увидело» | промежуточные показатели улучшились, главный клинический исход — нет |
| Presto | пример «без человека на линии» | заказы в значительной части обрабатывали операторы-люди |
| Больница Bradford | «до 53,4 мин», «ранняя фаза» | прирост на 53,4 мин в третьей из четырёх фаз |
| McDonald’s и IBM | «около 80%» | две оценки BTIG: 2022 и весна 2024 года |
| Свежая наука | «30 работ за март–сентябрь» | 29 в окне, ещё одна вне окна; приложение со всеми 30 работами |
Пять новых фактов, которые редактор добавил из открытых источников, аудитор подтвердил по первоисточникам; одна неточность («266 тыс. человек» вместо «наблюдений») исправлена.
Насколько выводы зависят от спорных правил
От трёх правил, которые владелец ещё не утвердил, зависят 19 случаев: исторический контроль в медицине — 8, окно по дате исхода — 6, соавторы из самой компании — 5. Без них остаётся 106 случаев: 33 успеха, 26 смешанных, 47 неуспехов.
- Держится: неуспехов больше, чем успехов; ИИ, решающий сам, — 1 успех из 14; госорганы — 1 из 14; рандомизированные испытания — успех реже чем в половине; распознавание лиц и скоринг людей чаще всего заканчиваются неуспехом.
- Слабеет: сортировка потока — 5 успехов из 12 вместо 9 из 16.
- Не держится: ухудшение навыков (2 случая → 0) и разработка ПО (4 → 1).
Полная таблица — в конце главного обзора.
Язык: итоговые оценки
Порог плана — 8,5. Оценки независимого аудитора до и после исправлений:
| Документ | До | После |
|---|---|---|
| Главный обзор | 8,4 | 8,6 |
| Определения | 7,1 | 8,0 |
| Свежая наука | 7,3 | 7,6 |
| Карта случаев, вводная часть | 7,6 | 8,1 |
| Разборы (выборка из 10) | 7,1–8,2 | 7,8–8,5 |
Оценка ru-score заметно колеблется между прогонами одного и того же текста (до ±0,5). После последнего прогона координатор внёс ещё точечные правки; повторно их не оценивали. Оставшиеся замечания — в основном повторы одного факта в разных разделах разбора. Решение владельца от 24.09.2026: больше прогонов не делать, принять тексты в текущем виде.
Карта пробелов
| Пробел | Что видно в корпусе | Что это значит |
|---|---|---|
| Россия | 0 проверенных случаев: российские истории остались самоотчётами | Для российского руководителя обзор опирается на зарубежный опыт; нужен отдельный поиск измеренных исходов |
| Отрасли вне медицины | Медицина — 77 из 125; промышленность и энергетика — 3, финансы — 2, медиа — 2, ритейл и электронная торговля — 9 | Выводы о «найти и отсортировать» держатся в основном на больницах |
| Экономика | Ни одна из 22 компаний, раскрывших эффект ИИ в отчётности, не прошла проверку | Денежный эффект ИИ почти не измерен независимо |
| AI-native как состояние компании | 118 из 125 — перестройка одного процесса; 6 — автономный агент; 1 — компания, построенная вокруг ИИ | Проверенных примеров перестройки операционной модели нет |
| Агенты | 3 случая с агентными системами | Самая обсуждаемая тема почти без измеренных исходов |
| Ухудшение навыков | 2 случая, оба зависят от спорных правил; есть противоречащее исследование | Рекомендация следить за навыками — мера предосторожности |
| Независимость проверки | Проверяли ИИ-модели, не люди | Для выводов, на которых будут строиться решения, нужна выборочная проверка человеком |
Что осталось владельцу
- Утвердить или отклонить три правила: окно по дате исхода, соавторы из компании, исторический контроль в медицине.
- Решить, нужен ли добор по пробелам — Россия, промышленность, финансы, агенты.
- Принять пакет; отдельно — решения об отправке группе и о веб-версии обзора.
Рабочие материалы аудита: содержание, техника, язык, закрытие — факты, закрытие — язык. Реестры — v1.0.