AI Native
Историческая редакцияСохранена для понимания развития проекта.
Исследования

AI-native — проверка исходов E4, срез v0.6

Независимую проверку выдержали 62 случая из 120 (в v0.5 было 42). Новые 20 случаев дали три направления: решения регуляторов о биометрии и автоматизированных решениях в организациях (10), клинические исследования ИИ в реальной работе…

Заголовок источника

Что выдержало независимую проверку — срез v0.6

О статусе материала

review

Независимую проверку выдержали 62 случая из 120 (в v0.5 было 42). Новые 20 случаев дали три направления: решения регуляторов о биометрии и автоматизированных решениях в организациях (10), клинические исследования ИИ в реальной работе больниц (5) и полевые исследования в школах, университетах и компаниях (5). Среди 62 засчитанных 32 неуспеха, 16 смешанных исходов и 14 успехов; уровень A — 17, B — 45. Это промежуточный срез по правилу «примерно каждые 20 засчитанных». Работа продолжается: к моменту среза идут 6 исследовательских пакетов и 1 проверка.

Срез продолжает v0.5; там описаны основание, правила координатора и причины отказов — они не изменились. Все 487 вердиктов с замечаниями проверяющих — в таблице вердиктов v0.6.

План, факт, пробел

Показатель План v0.5 v0.6 Пробел
Проверенные случаи A/B с установленным исходом ≥ 120 42 (A — 4, B — 38) 62 (A — 17, B — 45) 58
Из них неуспешные и смешанные ≥ 30 33 48 (32 + 16) выполнено
Независимая перепроверка кандидатов в 120 все все все —
Всего вердиктов / из них независимого проверяющего — 401 / 321 487 / 388 —
США / Китай / Россия / другие страны среди засчитанных покрытие всех 18 / 5 / 0 / 19 22 / 6 / 0 / 34 Россия

Засчитанные случаи — новые в v0.6 (20)

Случай Уровень, исход Почему засчитан Оговорка
UC San Diego Health, ИИ-черновики ответов пациентам A, неуспех РКИ с листом ожидания и контролем 70 врачей (JAMA Netw Open 2024), журналы Epic: время чтения +21,8%, время ответа не изменилось Авторы — внедряющая больница, конфликта с вендором нет
Stanford Health Care, ИИ-черновики ответов B, смешанный Время во «входящих» по Epic без изменений; выгорание по валидированным шкалам значимо снизилось Одна группа, 5 недель, опросы заполнили 45%
Bradford Royal Infirmary, ИИ-командный центр A, смешанный Оценка NIHR с контрольной больницей (Хаддерсфилд), рутинные данные: часть показателей лучше, часть хуже, длительность госпитализации без изменений Вклад программной (ИИ) части не выделен
DrDoctor (Ноттингем), ИИ-прогноз неявок A, неуспех Независимая оценка LSBU по гранту NHS AI Award: разность разностей по неявкам +1,16 п.п. не в пользу технологии (незначимо) —
Limbic Access в NHS Talking Therapies B, успех Публичные данные NHS Digital, 14 служб с чат-ботом и 14 контрольных: рост направлений Все 6 авторов связаны с Limbic, работу финансировала Limbic
EEF/NFER, ChatGPT для планирования уроков (68 школ Англии) A, успех Школьно-рандомизированное РКИ, 259 учителей, независимый оценщик NFER: время на подготовку сократилось, качество по слепой экспертизе не хуже Время — дневники учителей
FEV Tutor, Tutor CoPilot B, смешанный Предрегистрированное РКИ на реальных сессиях со школами Title I Ведущий автор строила инструмент вместе с FEV
Georgia State University, чат-бот студенческих сервисов B, успех Предрегистрированный эксперимент, административные данные: рост показателей студентов Бот негенеративный; данные 2021–2023; 5 из 11 авторов — из GSU
Китайская ИТ-консалтинговая фирма, ChatGPT сотрудникам A, успех РКИ в реальной работе (Journal of Applied Psychology 2025): креативность по оценке руководителей, не знавших об эксперименте Неделя, p = 0,049; внедрение после пилота не найдено (прецедент UCLA)
Управляющий активами в Западной Европе, ИИ-аналитика контакт-центра A, успех Ступенчатое внедрение с контролем, внешние авторы (IZA DP 18224): время звонка −60 с (−9%) Рабочая статья без рецензии; KPI компании
Минобразования Кореи, ИИ-учебники AIDT B, неуспех Закон 04.08.2025 лишил статуса; охват школ упал с 37% до 19% Откат политический, неэффективность ИИ не измерялась
Парана (Бразилия), распознавание лиц в школах B, неуспех Превентивная мера ANPD (08.2026) приостановила систему Решение не окончательное; штат прекратил систему раньше по окончании контракта
Serco Leisure, биометрический учёт рабочего времени A, неуспех Предписание ICO (23.02.2024) прекратить обработку на 38 объектах —
Foodinho (Glovo), автоматизированные решения по курьерам A, неуспех Garante: штраф 5 млн €, автоматизированные деактивации без гарантий ст. 22, запрет распознавания лиц Может быть обжаловано
Uber, автоматическая деактивация водителей A, неуспех AP (21.08.2026): штраф ≈ 825 млн € за полностью автоматизированные решения; Uber прекратил практику ML прямо не установлен; Uber обжалует
Canadian Tire (Британская Колумбия), распознавание лиц A, неуспех Отчёт OIPC BC 23-02 (04.2023): нарушение закона Система снята в 2021; засчитано по правилу окна
Cartonajes Bañeres (Испания), 3D-распознавание лиц для учёта времени A, неуспех Резолюция AEPD: штраф 220 000 € —
Albero Forte Composite (Испания), распознавание лиц для учёта времени A, неуспех Резолюция AEPD PS-00597-2022: штраф оплачен со скидкой (признание ответственности) Исполнитель считал компанию неназванной; её назвал проверяющий по первичному документу
Parque de los Cipreses (Богота), распознавание лиц для доступа A, неуспех Предписание SIC (08.2025): удалить данные, ввести альтернативный вход Предписание, не штраф
Буэнос-Айрес, система распознавания лиц SRFP B, неуспех Апелляция (28.04.2023) подтвердила неконституционность и обусловила запуск проверками Число пострадавших приводит только соистец CELS

Засчитанные ранее 42 случая — в v0.5 и v0.4.

Что изменилось с v0.5

Решения регуляторов о процессах организаций стали вторым источником после медицины. Работают решения о распознавании лиц и биометрии у работодателей, в ритейле, жилых комплексах и школах, а также решения об автоматизированных решениях по работникам (ст. 22 GDPR). Не проходят: трудовые споры курьеров без анализа ML, дактилоскопические считыватели без ML (CTC), алгоритмический контроль сканеров на складах Amazon France (в решении Conseil d'État 2025 ИИ нет), разрешения регулятора без исхода (ФК «Копенгаген»), исследовательские проекты по сбору данных для ИИ (Тренто).

Новые решения координатора (все — в adjudications.json): Uber/AP засчитан как решение о самой автоматизированной системе, хотя ML прямо не установлен; китайская консалтинговая фирма — по прецеденту UCLA (реальная работа во время пилота); GSU — предмет E4 не ограничен генеративным ИИ; Тренто — не засчитан.

Направления без выхода в этом отрезке: официальные аудиты госИИ (IRS, Онтарио, DGFiP, TfL — 0 из 5: аудит оценивает управление проектом, а не исход), здравоохранение стран с низким и средним доходом (0 из 5: не выделен вклад ИИ, прогнозы затрат, диагностическая точность), полевые эксперименты в Европе, Латинской Америке и Африке (исследований мало).

Ограничения

Действуют ограничения v0.5. Дополнительно: 9 из 20 новых случаев — решения регуляторов о приватности; они устанавливают незаконность процесса, а не его экономический или операционный результат, это нужно учитывать при синтезе. Часть решений не окончательна (Uber, Foodinho, Парана). Процессные нарушения исполнителей повторялись (черновики в /tmp), повреждений файлов нет; новых инцидентов с данными пользователя не было.

Прогноз и решение для владельца

Израсходовано около 1 020 из 2000 поисков сессии. После v0.5 выход вырос: 20 засчитанных примерно на 12 проверенных пакетов. На оставшиеся ~980 поисков можно провести ещё около 25 пакетов с проверками. При выходе 1–1,5 на пакет итог сессии — примерно 85–100 из 120 (HYPOTHESIS; выход в регуляторах и медицине будет падать по мере исчерпания). Решения владельца из v0.5 остаются открытыми: бюджет для 120 (вероятно, нужна ещё одна сессия), правило окна (теперь от него зависят также Canadian Tire), прецедент соавторов из компании.

Где что лежит

Реестр 01 Реестры/v0.6/e4_verdicts.jsonl и manifest.json; v0.5 и ранее не изменены. Рабочие материалы — 02 Рабочие материалы/e4-v07. Результат в review, не принят владельцем. E5–E7 не поручены.