{
 "packet_id": "W8-FIELD-OPS-4",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T11:52:23Z",
 "entities": [
  {
   "entity_id": "W8-FIELD-OPS-4-01",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": true,
   "issues_ru": [
    "Открытый документ — не полный отчёт, а 4-страничная сводка-инфографика (в метаданных PDF заголовок «Skin Analytics DRAFT v3», автор Unity Insights, сделано в Canva). Методика и таблицы в ней не раскрыты. Уровень A по правилу «лично открыт первичный документ с прозрачным измерением» не заслужен → B.",
    "Независимость: оценщик (Unity Insights / University of Surrey, по заказу DHSC) не зависит от вендора. Но данные о работе DERM получены из развёртываний Skin Analytics на площадках трастов, а сама сводка, судя по метаданным, готовилась вместе с вендором. Это независимая интерпретация, но не независимое происхождение данных.",
    "Цифры 97,4%, 12,6%, 18,2%, 60,1%, 36% (n=754), 41% (n=307), 7 раков, 85%/13%, £1,7 и £1,1 на £1, а также цитаты в сводке подтверждаю. Однако «£ за £1» и «2 600 сэкономленных приёмов» — результат моделирования (CBA), а не измерение. CUA в самом документе названа «broadly inconclusive».",
    "Ключевое ограничение автор упомянул слишком мягко. В документе: «Direct comparative data at a granular level could not be obtained, making inferences about the effect of DERM over and above existing pathways difficult to answer». Сотрудники называют эффект «transformational», но документ прямо пишет, что неясно, заслуга ли это DERM или телемедицины. Измерены изменения работы — доля выписок без очного приёма (60,1% в хабе) и отмены при втором чтении. Эффект сверх прежнего маршрута не измерен.",
    "NIHR EVA (PMC12951253) — мета-анализ точности по 4 исследованиям DERM. Это точность модели, а не исход работы организации, и он не подтверждает эффект на 4 площадках. Как «второе происхождение» для исхода его засчитывать нельзя. Поиск показал, что в мае 2025 г. NICE условно рекомендовал DERM на 3 года с дополнительным сбором доказательств (страницу NICE лично не открывал). Это согласуется с исходом mixed.",
    "Итог: B, mixed. Засчитать можно: ИИ реально изменил маршрут триажа на площадках NHS, исход смешанный (безопасность и точность в живом процессе подтверждены, экономический эффект не доказан). Окно: оценка 2025 г. — в пределах 2023–2026."
   ],
   "added_evidence": [
    {
     "url": "https://arc-kss.nihr.ac.uk/document-download/798-evaluation-of-deep-ensemble-for-the-recognition-of-malignancy-derm/file",
     "publisher": "Unity Insights / University of Surrey (заказ DHSC)",
     "published": "2025 (метаданные PDF: изм. 20.08.2025)",
     "origin": "independent",
     "quote_original": "Direct comparative data at a granular level could not be obtained, making inferences about the effect of DERM over and above existing pathways difficult to answer.",
     "quote_ru": "Прямые сравнительные данные с нужной детализацией получить не удалось, поэтому трудно судить об эффекте DERM сверх существующих маршрутов."
    },
    {
     "url": "https://arc-kss.nihr.ac.uk/document-download/798-evaluation-of-deep-ensemble-for-the-recognition-of-malignancy-derm/file",
     "publisher": "Unity Insights / University of Surrey (заказ DHSC)",
     "published": "2025",
     "origin": "independent",
     "quote_original": "The study remained broadly inconclusive due to inconsistencies in the data, overshadowing the relatively small quality of life impact of DERM that could be quantified.",
     "quote_ru": "Из-за несогласованности данных исследование (CUA) осталось в целом неубедительным, что заслонило относительно небольшое измеримое влияние DERM на качество жизни."
    }
   ],
   "sources_opened": [
    "https://arc-kss.nihr.ac.uk/document-download/798-evaluation-of-deep-ensemble-for-the-recognition-of-malignancy-derm/file",
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC12951253/"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-4-03",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Главная ошибка — вклад ИИ не установлен. Я прочитал полный отчёт Gertler/Kwan/Wellsjo/Condo (28.06.2024): в нём ни разу нет слов «AI», «artificial intelligence», «algorithm», «symptom checker». Отчёт сравнивает телемедицину Babyl (медсёстры и врачи по телефону) с очной помощью (CC). Все эффекты — CCM при ОРВИ почти на 30% выше, ожидание на час меньше, меньше анализов — относятся к каналу телемедицины, а не к ИИ-триажу. Роль ИИ в изменении работы подтверждена только медийно (Digital Health, 12.2021, факт запуска), а его эффект не измерен.",
    "Независимость отчёта от Babylon подтверждаю: грант University of Rwanda от Фонда Гейтса, SP-аудит. Для исхода «телемедицина vs очная помощь» это сильное доказательство уровня A. Но сущность оформлена как ИИ-кейс, а для ИИ-компонента уровень — C (только факт внедрения по СМИ).",
    "Закрытие сервиса в 09.2023 — следствие банкротства Babylon Health (Chapter 7). Это не исход работы ИИ и не может быть частью исхода mixed. По ИИ исход unknown.",
    "Цитата неточная. Дословно: «In our setting, we find that telemedicine improves quality of care, improves efficiency, and reduces provider bias in response to patient requests.» Число звонков SP в отчёте — 1 218, а не 1 213.",
    "Окно: данные 2022–2023, отчёт 2024 — в окне. Но при отсутствии вклада ИИ засчитывать нельзя."
   ],
   "added_evidence": [
    {
     "url": "https://ciichin.org/wp-content/uploads/2025/01/The-Effect-of-Telemedicine-on-Quality-of-Care-in-Rwanda.pdf",
     "publisher": "UC Berkeley / UCSF / UCSD / CIIC-HIN (University of Rwanda)",
     "published": "2024-06-28",
     "origin": "independent",
     "quote_original": "In our setting, we find that telemedicine improves quality of care, improves efficiency, and reduces provider bias in response to patient requests.",
     "quote_ru": "В наших условиях телемедицина повышает качество помощи, эффективность и снижает предвзятость провайдера в ответ на запросы пациентов (про ИИ в отчёте ничего нет)."
    }
   ],
   "sources_opened": [
    "https://ciichin.org/wp-content/uploads/2025/01/The-Effect-of-Telemedicine-on-Quality-of-Care-in-Rwanda.pdf"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-4-04",
   "checked": true,
   "verdict": "upgrade",
   "evidence_level": "A",
   "outcome": "mixed",
   "counted_in_120": true,
   "issues_ru": [
    "Дубля нет: в known-entities.txt нет ни UCLA, ни Nabla/DAX-кандидата от UCLA. Строки про Dragon Copilot относятся к Cooper и Intermountain, Denver Health — отдельный кандидат CAND-fc294f5a2855ce6a. В E4A-US-04 это РКИ приводилось только как сравнение для Denver Health. Организация — UCLA Health: РКИ встроено в рутинную амбулаторную практику (238 врачей, около 72 000 визитов). Это реальное изменение работы на время пилота. Данных о последующем масштабировании в UCLA Health поиск не дал.",
    "Уровень повышен до A. Я лично открыл аннотацию издателя (NEJM AI 2025; 2(12), DOI 10.1056/AIoa2501000, PMID 41497288, через NCBI E-utilities): прозрачное измерение по логам EHR, ДИ и p-значения, пререгистрация NCT06792890. От вендоров исследование независимо: финансирование — UCLA DoM, UCLA Faculty Practice Group, NIH/NIA. Оговорка: данные и анализ принадлежат самой организации-внедренцу (UCLA Health, в т.ч. Chief AI Officer), но это рецензируемое РКИ, а не отчёт вендора.",
    "Фактическая ошибка в metrics. «DAX: −18 сек/запись» неверно: 18 секунд — снижение в КОНТРОЛЬНОЙ группе (с 4:22 до 4:04). У Nabla снижение 41 с (с 4:30 до 3:49). По аннотации: Nabla −9,5% против контроля (95% ДИ −17,2…−1,8; p=0,02), DAX −1,7% (95% ДИ −9,4…+5,9; p=0,66).",
    "Цитата «Nabla reduced time-in-note versus the control… need confirmation in larger, multicenter trials» дословно есть в аннотации NEJM AI (PubMed), а не на странице UCLA Health, к которой её привязал автор. Пресс-релиз UCLA датирован 26.11.2025, а не «2025–2026».",
    "Исход mixed подтверждаю: по первичной метрике значимый, но скромный эффект только у одного из двух продуктов, вторичные метрики выгорания предварительны, отмечены «occasional» клинически значимые неточности и одно нежелательное событие 1-й степени. Окно: 11.2024–01.2025, публикация 11.2025 — в окне."
   ],
   "added_evidence": [
    {
     "url": "https://pubmed.ncbi.nlm.nih.gov/41497288/",
     "publisher": "NEJM AI (аннотация в PubMed)",
     "published": "2025-11-26",
     "origin": "independent",
     "quote_original": "Nabla users experienced a 9.5% (95% confidence interval [CI], -17.2% to -1.8%; P=0.02) decrease in time-in-note versus the control group, whereas DAX users exhibited no significant change versus the control group (-1.7%; 95% CI, -9.4% to +5.9%; P=0.66).",
     "quote_ru": "У пользователей Nabla время в заметке сократилось на 9,5% (95% ДИ −17,2…−1,8%; p=0,02) по сравнению с контролем, у пользователей DAX значимого изменения нет (−1,7%; 95% ДИ −9,4…+5,9%; p=0,66)."
    },
    {
     "url": "https://www.uclahealth.org/news/release/ucla-study-finds-ai-scribes-may-reduce-documentation-time",
     "publisher": "UCLA Health",
     "published": "2025-11-26",
     "origin": "company",
     "quote_original": "Physicians using Nabla saw their average time spent writing each note decrease by an estimated 41 seconds (from 4 minutes 30 seconds to 3 minutes 49 seconds) vs 18 seconds (from 4 minutes 22 seconds to 4 minutes 4 seconds) in the control arm.",
     "quote_ru": "У врачей с Nabla среднее время на заметку сократилось примерно на 41 с (с 4:30 до 3:49), в контрольной группе — на 18 с (с 4:22 до 4:04)."
    }
   ],
   "sources_opened": [
    "https://www.uclahealth.org/news/release/ucla-study-finds-ai-scribes-may-reduce-documentation-time",
    "https://eutils.ncbi.nlm.nih.gov/entrez/eutils/efetch.fcgi?db=pubmed&id=41497288&retmode=xml",
    "https://connect.uclahealth.org/dom/2026/01/08/ambient-ai-scribes-in-clinical-practice-a-randomized-trial/"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-4-05",
   "checked": true,
   "verdict": "upgrade",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "Первичная аннотация издателя доступна: Lancet Digital Health 2025;7(12):100927, PMID 41339157, открыта мной через NCBI E-utilities. Автор не нашёл этот путь и опирался на пресс-релизы вендора.",
    "Происхождение данных независимо от вендора: национальный аудит SSNAP (все 107 больниц Англии, 2019–2023). Есть контроль по площадкам — 26 площадок оценки против остальных. Авторы смешанные: 3 сотрудника Brainomix (Woodhead, Fernandez, Papadakis), остальные — NHS-трасты, Oxford, Health Innovation Oxford. Финансирование — AI in Health and Care Award (NHS England AAC). Уровень B, а не A: дизайн наблюдательный, анализ частично выполнен сотрудниками вендора.",
    "Цифры подтверждаю: 2,3%→4,6% (376/15 969 → 751/15 428) на площадках оценки, 1,6%→2,6% на прочих площадках, OR взаимодействия 1,24 (95% ДИ 1,08–1,43; p=0,0026), OR на уровне пациента 1,57 (1,33–1,86). Заявление «сокращение времени более чем на час» в аннотации не найдено — это данные пресс-релиза.",
    "Исход success в пределах измеренной метрики (доля тромбэктомии) допустим. Остаётся риск отбора больниц, это оговорка. Окно: публикация 12.2025 — в окне."
   ],
   "added_evidence": [
    {
     "url": "https://pubmed.ncbi.nlm.nih.gov/41339157/",
     "publisher": "The Lancet Digital Health (аннотация в PubMed)",
     "published": "2025-12",
     "origin": "independent",
     "quote_original": "For evaluation sites, the pre-implementation endovascular thrombectomy rate was 2·3% (376 of 15 969 patients) and the post-implementation rate was 4·6% (751 of 15 428 patients), a relative increase of 100%.",
     "quote_ru": "На площадках оценки доля тромбэктомии до внедрения составляла 2,3% (376 из 15 969), после — 4,6% (751 из 15 428), относительный рост 100%."
    }
   ],
   "sources_opened": [
    "https://eutils.ncbi.nlm.nih.gov/entrez/eutils/efetch.fcgi?db=pubmed&id=41339157&retmode=xml"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-4-06",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "failure",
   "counted_in_120": true,
   "issues_ru": [
    "Статья, на которой автор построил уровень A и исход (JAMIA Open 2024, PMC11560849; лично открыл полный текст на PMC), — ретроспективная валидация ТОЧНОСТИ модели на данных 2023 г. Чувствительность 14,7%, PPV 7,6%, медианное опережение 0 мин подтверждаю. Но это точность модели, а не исход работы организации. Автор вывел failure из точности, что противоречит уроку 23.09.",
    "Автор пропустил статью об исходе работы тех же двух ЭО: JAMIA 2026;33(2):404–408, PMID 41293980, аннотацию открыл лично. В ней сравниваются клинические исходы при правиле SIRS+ (01.2018–06.2022) и при алерте Epic ESPMv1 (12.2022–01.2024), 881 201 пациент. Различий нет: время до антибиотиков 5,1 против 5,9 ч, до посевов 3,6 против 3,5 ч, до запроса ОРИТ 10,4 против 9,6 ч; после поправки на невакцинированных от COVID нет и различия в смертности (OR 0,95). Это и есть измеренный исход работы: замена правила на модель Epic не улучшила процесс → failure (нулевой эффект). Засчитывать по этому основанию.",
    "Уровень B, а не A: исход подтверждён аннотацией издателя, полный текст не открыт (403). Дизайн «до/после» с периодом COVID. Авторы — UT Health, Baylor и сотрудники самой Harris Health, от Epic независимы (в JAMIA Open: «no competing interests», без финансирования). Данные — EHR самой организации.",
    "quote_original в research.json не дословна: склеена из фрагментов и пересказа. Дословно: «This suggests that the ESPMv1 alert is adding little assistance to physicians identifying sepsis.» и «The ESPMv1 provides suboptimal diagnostic characteristics for undifferentiated patients in a county ED.»",
    "Оговорка по жанру: ESPMv1 — penalized logistic regression, то есть «ИИ» в широком смысле (предиктивная ML-модель в EHR). Окно: исход опубликован в 2024–2026 гг., данные 2023 г. — в окне."
   ],
   "added_evidence": [
    {
     "url": "https://pubmed.ncbi.nlm.nih.gov/41293980/",
     "publisher": "JAMIA (Oxford University Press), аннотация в PubMed",
     "published": "2026-02-01 (онлайн 2025)",
     "origin": "independent",
     "quote_original": "No statistical differences in time to antibiotics (5.1 vs 5.9 h), time to blood culture draws (3.6 vs 3.5 h) or time to ICU admission (10.4 vs 9.6 h) were observed.",
     "quote_ru": "Статистически значимых различий во времени до антибиотиков (5,1 против 5,9 ч), до забора посевов крови (3,6 против 3,5 ч) и до госпитализации в ОРИТ (10,4 против 9,6 ч) не выявлено."
    },
    {
     "url": "https://pubmed.ncbi.nlm.nih.gov/41293980/",
     "publisher": "JAMIA (Oxford University Press), аннотация в PubMed",
     "published": "2026-02-01",
     "origin": "independent",
     "quote_original": "No statistically significant clinical differences or performance metrics were observed between SIRS+ based alerting and ESPMv1 alerts in an undifferentiated emergency department population. Both alerting systems had similarly poor diagnostic characteristics.",
     "quote_ru": "Статистически значимых различий в клинических исходах и метриках работы между оповещением по SIRS+ и алертом ESPMv1 не выявлено; обе системы имели одинаково слабые диагностические характеристики."
    },
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC11560849/",
     "publisher": "JAMIA Open",
     "published": "2024-11-13",
     "origin": "independent",
     "quote_original": "This suggests that the ESPMv1 alert is adding little assistance to physicians identifying sepsis.",
     "quote_ru": "Это говорит о том, что алерт ESPMv1 мало помогает врачам выявлять сепсис."
    }
   ],
   "sources_opened": [
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC11560849/",
    "https://eutils.ncbi.nlm.nih.gov/entrez/eutils/efetch.fcgi?db=pubmed&id=41293980&retmode=xml"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-4-07",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "Дубль уже засчитанного CAND-9e17821375e2fcc0 (E4A-US-02, B/failure, counted). В adjudications.json есть аннотация о дубле. Повторно не засчитывается. Проверял кратко, без поиска.",
    "Уровень A завышен — вывод проверяющего E4A-US-02: у The Markup нет количественного метода, только примеры. Метрика «≈500 000 USD/год» некорректна: мэр не указал «в год», а The Markup пишет, что стоимость поддержки неясна."
   ],
   "added_evidence": [],
   "sources_opened": [
    "packets/E4A-US-02/verify.json (локально)"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-4-09",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "failure",
   "counted_in_120": true,
   "issues_ru": [
    "Официальной оценки (Cour des comptes, отчёт DINUM или ANCT) с измерениями не найдено. Опубликованной статистики ошибок и экономии времени нет. Исход failure держится на трёх вещах: признании организации против собственного интереса (кабинет министра Амьеля: «Albert n’a pas très bien fonctionné, le projet est terminé»), официальном решении не распространять инструмент (DINUM, 09.01.2026) и претензиях профсоюзов и агентов (Cash Investigation). Этого достаточно для B/failure по аналогии с MyCity, но решение о нераспространении само по себе — объявленное решение, а не измеренный исход. Отметить в тексте.",
    "Происхождение: weka.fr — перепечатка депеши AFP от 12.01.2026 (не «Weka / DINUM, regulator»). origin = media, цитирует DINUM. Претензии профсоюзов тоже известны только в пересказе AFP. Отдельного источника от профсоюзов и выпуска Cash Investigation автор лично не открывал.",
    "Ошибка атрибуции: «Albert France services a rempli son rôle de démonstrateur» сказал Ishan Bhojwani (со-руководитель), а не Nathanaël Romano. Дословно: «De notre point de vue, Albert France services a rempli son rôle de démonstrateur, en montrant que cette technologie était capable de répondre à de potentiels cas d’usage métiers». Там же уточняется, что France Services входят в периметр ANCT, а не DINUM.",
    "Масштаб пилота: официальная страница France Services (16.02.2024, обновлена 29.11.2024) — бета в «plus de 40 France services, représentant près de quatre-vingt conseillers». В 2026 г. AFP пишет о 48 центрах. Изменение работы реально, но охват мал: около 80 консультантов из 2 750 центров.",
    "«Bilan à l’été 2026» в депеше AFP относится к эксперименту Assistant IA (10 000 агентов), а не к Albert France Services. Поиск не нашёл опубликованного итога. Окно: 2024–2026 — в окне."
   ],
   "added_evidence": [
    {
     "url": "https://acteurspublics.fr/articles/de-chatbot-experimental-a-socle-interministeriel-pour-lia-de-letat-le-parcours-dalbert-ia/",
     "publisher": "Acteurs Publics",
     "published": "2026-02-13",
     "origin": "media",
     "quote_original": "“Albert n’a pas très bien fonctionné, le projet est terminé” , révélait, début janvier, le cabinet du ministre de la Fonction publique et de la réforme de l’État, David Amiel",
     "quote_ru": "«Albert работал не очень хорошо, проект завершён», — сообщил в начале января кабинет министра госслужбы и реформы государства Давида Амьеля."
    },
    {
     "url": "https://www.weka.fr/actualite/administration/article/albert-l-outil-d-ia-generative-experimente-a-france-services-ne-sera-pas-generalise-209194/",
     "publisher": "Weka (депеша AFP)",
     "published": "2026-01-12",
     "origin": "media",
     "quote_original": "L’outil d’intelligence artificielle (IA) générative Albert, développé en interne par l’administration française et expérimenté dans 48 maisons France Services, ne sera pas généralisé « dans sa forme actuelle », a indiqué vendredi 9 janvier la Direction interministérielle du numérique (DINUM).",
     "quote_ru": "Генеративный ИИ-инструмент Albert, разработанный внутри французской администрации и испытанный в 48 центрах France Services, не будет распространён «в нынешнем виде», сообщила 9 января DINUM."
    },
    {
     "url": "https://www.france-services.gouv.fr/actualites/experimentation-dun-modele-dassistance-france-services-IA",
     "publisher": "France services (ANCT), официальный сайт",
     "published": "2024-02-16 (обновл. 2024-11-29)",
     "origin": "company",
     "quote_original": "La version beta du modèle Albert est actuellement en phase de test au sein de plus de 40 France services, représentant près de quatre-vingt conseillers France services",
     "quote_ru": "Бета-версия Albert тестируется более чем в 40 центрах France Services, это около восьмидесяти консультантов."
    }
   ],
   "sources_opened": [
    "https://www.weka.fr/actualite/administration/article/albert-l-outil-d-ia-generative-experimente-a-france-services-ne-sera-pas-generalise-209194/",
    "https://acteurspublics.fr/articles/de-chatbot-experimental-a-socle-interministeriel-pour-lia-de-letat-le-parcours-dalbert-ia/",
    "https://www.france-services.gouv.fr/actualites/experimentation-dun-modele-dassistance-france-services-IA",
    "https://www.generation-nt.com/actualites/ia-albert-etat-francais-mistral-dinum-echec-2069044"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-OPS-4-02",
  "W8-FIELD-OPS-4-08"
 ],
 "packet_notes_ru": "Фактическое число WebSearch: 6 (бюджет ≤10). Проверены все 5 предложенных к засчитыванию (01, 03, 04, 06, 09), дубль 07 (кратко) и из остальных — 05 (1 из 3, ≥25%). 02 и 08 (C, не засчитываются) не проверялись. Системные ошибки автора: (1) точность модели выдана за исход работы (06 — пропущена статья JAMIA 2026 об исходах; 01 — мета-анализ точности NIHR EVA засчитан как второе происхождение исхода); (2) эффект канала приписан ИИ (03 — отчёт о телемедицине Babyl вообще не упоминает ИИ); (3) неверные числа и цитаты не с тех страниц (04 — 18 с контроля записаны как эффект DAX, цитата аннотации привязана к пресс-релизу; 06 и 03 — quote_original не дословны; 09 — цитата «démonstrateur» приписана не тому человеку, перепечатка AFP помечена как regulator); (4) не использован доступ к аннотациям издателей через NCBI E-utilities (efetch) при 403 или cookie-заглушке — так открыты аннотации 04, 05, 06. Итог по засчитыванию: 01 (B/mixed), 04 (A/mixed), 05 (B/success, повышение с C), 06 (B/failure по исходам работы), 09 (B/failure) — да; 03 и 07 — нет. Рабочие загрузки — в packets/W8-FIELD-OPS-4/_vdl и _verify_dump.txt (черновики проверяющего)."
}