{"packet_id":"W8-FIELD-OPS","verifier":"claude-opus subagent","finished_at":"2026-09-23T00:00:00Z",
"entities":[
{"entity_id":"W8-FIELD-OPS-01","checked":true,"verdict":"confirm","evidence_level":"A","outcome":"success","counted_in_120":true,
"issues_ru":[
"Уровень A, success и зачёт подтверждаю. Это РКИ, встроенное в рутинный популяционный скрининг Региона Сконе (юго-запад Швеции, четыре площадки): решения о чтении и вызове на дообследование принимались на реальных женщинах. Это не ретроспективное испытание. Исход относится к работе этой скрининговой программы.",
"Ошибка автора: снижение интервального рака на 12% статистически НЕ значимо. Отношение 0,88 (95% ДИ 0,65–1,18); первичная конечная точка — non-inferiority (не хуже контроля). Слова «статистическая значимость» в outcome_basis_ru надо убрать. Формулировка: «не хуже по интервальному раку; чувствительность выше (80,5% против 73,8%, p=0,031); специфичность та же (98,5%); нагрузка на чтение −44,3%».",
"«81% против 74%» — это чувствительность (доля раков, найденных на скрининге: 338/420 против 262/355), а не частота выявления. «+9%» — относительный прирост; абсолютный — около 6,7 п.п.",
"ИИ-продукт установлен: Transpara v1.7.0 (ScreenPoint Medical) — по аннотации Lancet Oncology 2023 в Europe PMC. Финансирование публичное: Шведское онкологическое общество, Confederation of Regional Cancer Centres, ALF. Вендор среди спонсоров не указан. Декларацию конфликтов интересов полной статьи Lancet 2026 открыть не удалось (403) — это остаточная неопределённость.",
"Даты: рандомизация — апрель 2021 — декабрь 2022 (EurekAlert), а не июль 2022. Июль 2022 — срез промежуточного анализа из 80 020 женщин. Упоминание Lancet Digital Health 2024 в period путаное — удалить.",
"Метка agentic_interaction не обоснована: Transpara даёт риск-балл для сортировки на одиночное или двойное чтение, решения принимают рентгенологи. Оставить только process_restructuring.",
"Мета-анализ Clinical Imaging (ноябрь 2026; MASAI, ScreenTrustCAD, PRAIM) подтверждает направление: около +1 рака на 1000 без роста отзывов, −44,3% чтений в MASAI. Опровержений не найдено."],
"added_evidence":[
{"url":"https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=EXT_ID:37541274%20AND%20SRC:MED&format=json&resultType=core","publisher":"Europe PMC (аннотация Lancet Oncology 2023)","published":"2023-08","origin":"academic","quote_original":"Screen-reading workload was reduced by 44·3% using AI ... Transpara version 1.7.0","quote_ru":"Нагрузка на чтение снимков снизилась на 44,3% при использовании ИИ ... Transpara версии 1.7.0"},
{"url":"https://associationofbreastsurgery.org.uk/professionals/information-hub/publications/2026/interval-cancer-sensitivity-and-specificity-comparing-ai-supported-mammography-screening-with-standard-double-reading-without-ai-in-the-masai-study-a-randomised-controlled-non-inferiority-single-blinded-population-based-screening-accuracy-t","publisher":"Association of Breast Surgery (пересказ статьи Lancet)","published":"2026","origin":"retelling","quote_original":"1.55 vs 1.76 per 1000; ratio 0.88, 95% CI 0.65–1.18","quote_ru":"1,55 против 1,76 на 1000; отношение 0,88, 95% ДИ 0,65–1,18"},
{"url":"https://www.eurekalert.org/news-releases/1114399","publisher":"EurekAlert! (пресс-релиз по статье Lancet)","published":"2026-01-29","origin":"academic","quote_original":"81% of cancer cases (338/420) were detected at screening ... 74% of cancer cases (262/355) in the control group","quote_ru":"81% случаев рака (338/420) выявлены на скрининге ... 74% (262/355) в контрольной группе"}],
"sources_opened":["https://www.eurekalert.org/news-releases/1114399","https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=EXT_ID:37541274%20AND%20SRC:MED&format=json&resultType=core","https://associationofbreastsurgery.org.uk/professionals/information-hub/publications/2026/interval-cancer-sensitivity-and-specificity-comparing-ai-supported-mammography-screening-with-standard-double-reading-without-ai-in-the-masai-study-a-randomised-controlled-non-inferiority-single-blinded-population-based-screening-accuracy-t","https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=MASAI%20interval%20cancer%20AI-supported%20mammography&format=json&resultType=core","https://www.thelancet.com/journals/lancet/article/PIIS0140-6736(25)02464-X/abstract (403)","https://pubmed.ncbi.nlm.nih.gov/37541274/ (только cookie-страница)"]},

{"entity_id":"W8-FIELD-OPS-02","checked":true,"verdict":"reject_counting","evidence_level":"A","outcome":"unknown","counted_in_120":false,
"issues_ru":[
"Цифры подтверждаю: 774 (258/516), AUC Lunit 0,902, Nexus 0,897, qXR 0,878; финансирование — правительство Канады; вендоров от данных изолировали. Как независимое измерение точности продуктов — уровень A.",
"Но это не случай изменения работы организации. Оценка ретроспективная: CAD-программы прогнали по архивным снимкам национального опроса 2017–2019 (цитата: «digital chest x-ray images and metadata from individuals ... who participated in the South African national tuberculosis prevalence survey between Aug 15, 2017 and July 28, 2019»). В опросе ИИ решений не принимал. Внедрение продуктов национальной программой по ТБ по итогам статьи не подтверждено: в самой статье его нет. Модель влияния — гипотетическая популяция в 9000 человек, это прогноз, а не результат.",
"«Mixed» здесь — разброс точности 12 продуктов, а не исход работы конкретной программы. Для 120 исход — unknown. Годится как отраслевой бенчмарк или контекст, а не как кейс.",
"Неточность в human_role_ru: ИИ «в рамках национальной программы» не использовался — оценка шла вне клинического процесса.",
"Аффилиации авторов неточны. Среди них — Stop TB Partnership (Женева), Гейдельберг, SAMRC, HSRC, NICD, Минздрав ЮАР, ВОЗ (Претория). FIND в аффилиациях нет, но у одного автора есть гранты FIND. «Канада» — источник финансирования, а не учреждение авторов.",
"Порог ВОЗ (90/70) не достигнут ни одним продуктом; у Lunit и Nexus доверительные интервалы только перекрывают 70%. Этот вывод автора корректен."],
"added_evidence":[{"url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC11339183/","publisher":"The Lancet Digital Health / PMC","published":"2024-07-19","origin":"academic","quote_original":"Five products achieved greater than 60% specificity: Lunit, Nexus, JF CXR-2, qXR, and ChestEye, with Lunit and Nexus having CIs overlapping the target product profile target of 70% specificity.","quote_ru":"Пять продуктов показали специфичность выше 60%: Lunit, Nexus, JF CXR-2, qXR и ChestEye; доверительные интервалы Lunit и Nexus перекрывают целевые 70% специфичности."}],
"sources_opened":["https://pmc.ncbi.nlm.nih.gov/articles/PMC11339183/"]},

{"entity_id":"W8-FIELD-OPS-03","checked":true,"verdict":"reject_counting","evidence_level":"B","outcome":"mixed","counted_in_120":false,
"issues_ru":[
"Цифры подтверждаю: ИИ по RDR — чувствительность 93,33% (ДИ 68,05–99,83), специфичность 85,05%; неофтальмолог по RDR — 95,8% и 93,1%; по DR — 86,4% и 94,3%. Финансирование — ICMR; конфликт интересов: «None declared».",
"Это исследовательское сравнение точности (pragmatic diagnostic accuracy study): 600 человек в трёх группах, около 200 на группу, а не внедрение в практику Health and Wellness Centres. Роль ИИ в изменении работы организации не установлена, поэтому в 120 не засчитывается.",
"ИИ-продукт автор не назвал: Medios offline AI (Remidio NM FOP 10, смартфонная фундус-камера). Коммерческий алгоритм оценивали независимые от вендора авторы. Однако при подгруппе RDR около 15 человек ДИ чувствительности 68–99,8% — точность низкая. Для измерения ставлю B, а не A.",
"Ошибка в human_role_ru: снимки на дому делал обученный неофтальмолог (оператор), а не пациент.",
"Доля непригодных снимков — 38% в общине (дом) против 8% в HWC. Автор привёл только 38%; нужно указать контекст.",
"Ограничение диапазона: данные за февраль 2023 — январь 2024, публикация 18.03.2026 — верно."],
"added_evidence":[{"url":"https://pmc.ncbi.nlm.nih.gov/articles/PMC13007179/","publisher":"BMJ Open / PMC","published":"2026-03-18","origin":"academic","quote_original":"offline AI-enabled screening demonstrates potential for community use but is currently limited by image quality","quote_ru":"офлайн-скрининг с ИИ показывает потенциал для работы в общине, но пока ограничен качеством изображений"}],
"sources_opened":["https://pmc.ncbi.nlm.nih.gov/articles/PMC13007179/"]},

{"entity_id":"W8-FIELD-OPS-04","checked":true,"verdict":"needs_rework","evidence_level":"B","outcome":"mixed","counted_in_120":true,
"issues_ru":[
"Уровень B и mixed подтверждаю; зачёт в 120 — условный, после правок ниже. AFST работает с августа 2016 года в реальном процессе приёма обращений округа; роль модели в решениях screen-in установлена.",
"Период оценки Стэнфорда (Goldhaber-Fiebert, Prince): до внедрения — 01.01.2015–31.07.2016 (около 31 тыс. детей); после — 27.10.2019–31.03.2021 (около 20 тыс. детей; 17 месяцев, включая COVID-19). Данные — де-идентифицированные записи округа за 01.08.2013–31.03.2021. У Rittenhouse et al.: обращения 2010–2020, пост-период — июль 2016 — декабрь 2020. В карточке это надо указать явно.",
"Независимость: оценку Стэнфорда заказал и оплатил округ (сводка: «Goldhaber-Fiebert and Prince were commissioned»); сводку опубликовал сам DHS. Двое из трёх авторов рабочей статьи — разработчики AFST. Оба анализа построены на одних административных данных округа, независима только аналитика. Для B этого достаточно на пределе, для A — нет. Рабочая статья 2023 года не прошла рецензирование.",
"Атрибуция: сводка везде пишет «AFST and surrounding policy and practice changes». Эффект модели не отделён от других изменений политики.",
"Метрика «снижение case opening на 8 п.п. (20%)» в metrics приписана AFST, хотя сводка прямо относит её к другим изменениям политики («likely due to other County policy and practice changes»; CPS −18,4%). Её надо убрать или пометить как не связанную с ИИ.",
"Расхождение в изъятиях: в таблице округа у Rittenhouse — «Removals within 3 months 73%», в статье — 80% (DiD) и 77% (triple-diff). Сводка округа также пишет «suggestive evidence» об устранении разрыва по изъятиям на 100%, а не твёрдый результат.",
"Контрдоказательство, которого нет в карточке: в январе 2023 года Минюст США начал проверку AFST по жалобам на дискриминацию семей с инвалидностью (AP, PBS; найдено поиском). Исход проверки не установлен. Статья Samant et al. 2026 (T&F) автором не открыта. Её выводы в counter_evidence_ru изложены как факт, а должны быть SOURCE_CLAIM или UNKNOWN."],
"added_evidence":[
{"url":"https://analytics.alleghenycounty.us/wp-content/uploads/2024/05/23-ACDHS-19_FamilyScreeningToolUpdate_Summary.pdf","publisher":"Allegheny County DHS","published":"2023-09","origin":"regulator","quote_original":"This decrease in case openings was likely due to other County policy and practice changes: CPS referrals (where the AFST had no impact due to mandated investigation) also experienced a similar decline in case opening rates (18.4% decrease).","quote_ru":"Это снижение числа открытых дел, вероятно, вызвано другими изменениями политики и практики округа: по CPS-обращениям (где AFST не влиял, так как расследование обязательно) открытие дел снизилось так же (на 18,4%)."},
{"url":"https://analytics.alleghenycounty.us/wp-content/uploads/2024/05/23-ACDHS-19_FamilyScreeningToolUpdate_Summary.pdf","publisher":"Allegheny County DHS","published":"2023-09","origin":"regulator","quote_original":"post-implementation; October 27, 2019 through March 31, 2021 ... pre-implementation; primarily January 1, 2015 through July 31, 2016","quote_ru":"после внедрения — 27.10.2019–31.03.2021 ... до внедрения — в основном 01.01.2015–31.07.2016"},
{"url":"https://www.pbs.org/newshour/nation/ap-report-doj-examining-ai-screening-tool-used-by-pa-child-welfare-agency","publisher":"PBS NewsHour / AP","published":"2023-01-31","origin":"independent","quote_original":"AP report: DOJ examining AI screening tool used by Pa. child welfare agency","quote_ru":"AP: Минюст изучает ИИ-инструмент скрининга, используемый службой защиты детей Пенсильвании (заголовок из поисковой выдачи; страница не открывалась)"}],
"sources_opened":["https://analytics.alleghenycounty.us/wp-content/uploads/2024/05/23-ACDHS-19_FamilyScreeningToolUpdate_Summary.pdf","https://krittenh.github.io/katherine-rittenhouse.com/Algorithms%20Humans%20Racial%20Disparities.pdf","WebSearch: Allegheny Family Screening Tool Justice Department investigation disability discrimination"]},

{"entity_id":"W8-FIELD-OPS-05","checked":true,"verdict":"reject_counting","evidence_level":"B","outcome":"failure","counted_in_120":false,
"issues_ru":[
"Дубль W7-EU-OTHER-02 (Амстердам Smart Check), проверяется там. counted_in_120=false с пометкой «дубль W7-EU-OTHER».",
"Чего нет в W7-EU-OTHER/research.json (там один источник — MIT TR): (1) методологическая страница Lighthouse Reports «The Limits of Ethical AI» (11.06.2025), по ней проект окончательно закрыт осенью 2024 года («In the fall of 2024 ... the city shelved the project altogether»); (2) по ней же аудит шёл так: код и тесты журналистов запускали чиновники на реальных данных и возвращали агрегаты. Это не прямой доступ к данным, как пишет автор W8; (3) вывод «no more effective than the human case workers it was designed to replace».",
"Цифры W8 «+14% мужчины (май 2022)», «+20% точность после перевзвешивания» и «Deloitte ~€35 000» на странице Lighthouse не найдены. Их надо сверить с текстом MIT TR при проверке W7. Сумма Deloitte — SOURCE_CLAIM без подтверждения.",
"Уровень A в W8 завышен: MIT TR и Lighthouse — одна совместная расследовательская работа, одно происхождение. Оценка B в W7 обоснованнее."],
"added_evidence":[{"url":"https://www.lighthousereports.com/investigation/the-limits-of-ethical-ai/","publisher":"Lighthouse Reports","published":"2025-06-11","origin":"independent","quote_original":"In the fall of 2024, nearly a year since we originally began reporting, the city shelved the project altogether.","quote_ru":"Осенью 2024 года, почти через год после начала нашего расследования, город полностью свернул проект."}],
"sources_opened":["https://www.lighthousereports.com/investigation/the-limits-of-ethical-ai/"]},

{"entity_id":"W8-FIELD-OPS-06","checked":true,"verdict":"reject_counting","evidence_level":"B","outcome":"mixed","counted_in_120":false,
"issues_ru":[
"Дубль W7-EU-OTHER-01 (Роттердам), проверяется там. counted_in_120=false с пометкой «дубль W7-EU-OTHER».",
"Чего нет в W7-EU-OTHER/research.json: страница Lighthouse Reports «Suspicion Machines» (06.03.2023) — 315 входных переменных; вывод экспертов «performs little better than random selection»; упоминание Accenture. W7 опирается на WIRED, FTM, Pulitzer и racismandtechnology.center.",
"Число 12 707 обучающих расследований на странице Lighthouse не найдено — его источник не подтверждён.",
"CONFLICT с W7: в W8 — A и failure без даты приостановки; в W7 — B и mixed, использование в 2017–2021 годах, приостановка в конце 2021 года (до расследования), планы новой версии. Разрешить при проверке W7. Утверждение W8 «приостановлен после расследования» (март 2023) противоречит W7."],
"added_evidence":[{"url":"https://www.lighthousereports.com/investigation/suspicion-machines/","publisher":"Lighthouse Reports","published":"2023-03-06","origin":"independent","quote_original":"performs little better than random selection","quote_ru":"работает немногим лучше случайного отбора"}],
"sources_opened":["https://www.lighthousereports.com/investigation/suspicion-machines/"]},

{"entity_id":"W8-FIELD-OPS-07","checked":true,"verdict":"downgrade","evidence_level":"C","outcome":"success","counted_in_120":false,
"issues_ru":[
"Происхождение одно. 7 из 9 авторов — сотрудники JD.com («Supply Chain Tech Team Y, JD.com»), корреспондирующий автор — Yongzhi Qi (JD.com). Академические соавторы — Tsinghua (Lingjie Zhao, Wei Qi) и HKU (Zuo-Jun Max Shen) — участники проекта «in collaboration with JD.com», а не внешние проверяющие. Данные и параметры издержек — внутренние данные JD. Анализ сделали те же авторы. Внешнего подтверждения нет. По методике (v0.4 §7, v0.7 §2) это самоотчёт компании в научной форме, уровень C. В 120 не засчитывается.",
"Препринт arXiv без рецензии: v1 — 22.12.2025, v2 — 06.01.2026. В timeline автора ошибка: «v2, апрель 2025» — неверно; сотрудничество начато в январе 2025 года.",
"Методология: SKU для экспериментальной группы выбирали менеджеры JD (с высокой автоматизацией), контроль подобран PSM. Это не рандомизация. Статистической значимости и доверительных интервалов нет. Абсолютные значения скрыты (X/Y/Z). Потери от дефицита из оценки исключены (цитата: «the stockout rate and associated losses cannot be accurately evaluated. Therefore, these metrics are excluded»). Значит, вывод «без ухудшения ни по одному измерению» не обоснован.",
"Арифметика: 22,05 − 3,7 = 18,35 — это разность в п.п.; авторы называют её «relative reduction of 18.35%». Относительно тренда контроля: 1,037/1,2205 − 1 ≈ −15,0%. In-stock «+2,29%» в статье записан как «Y+2.29%» — п.п. или проценты, неясно; автор карточки уверенно пишет п.п.",
"Масштаб: 331 SKU (3 899 пар SKU–РЦ) в одной категории, 30 дней. Длительность эффекта не показана."],
"added_evidence":[{"url":"https://arxiv.org/pdf/2512.19001","publisher":"arXiv (авторы JD.com, Tsinghua, HKU)","published":"2026-01-06 (v2)","origin":"company","quote_original":"the selection of SKUs for the treatment group was determined by JD.com's managers based on specific business criteria, prioritizing SKUs with high automation rates","quote_ru":"SKU для экспериментальной группы отбирали менеджеры JD.com по бизнес-критериям, с приоритетом SKU с высокой долей автоматизации"}],
"sources_opened":["https://arxiv.org/abs/2512.19001","https://arxiv.org/pdf/2512.19001"]},

{"entity_id":"W8-FIELD-OPS-08","checked":true,"verdict":"downgrade","evidence_level":"B","outcome":"success","counted_in_120":false,
"issues_ru":[
"Решение «не в 120, adjacent_automation» подтверждаю: в тексте РКИ ИИ как часть сервиса Ama Krushi не описан. «Machine learning» относится к оценке урожайности по спутнику самими исследователями (раздел о вегетационных индексах).",
"Автор пропустил конфликт интересов. Двое из четырёх авторов (Harigaya, Zhu) — сотрудники PxD, исполнителя программы; Cole — член совета PxD (без вознаграждения). Оценку проводил сам исполнитель, текст — рабочая статья без рецензии. РКИ зарегистрировано, есть объективная мера урожайности по спутнику, поэтому ставлю B, а не A.",
"Период: РКИ шло в 2021–2022 годах (две когорты: 5 204 фермера и остальные, 18 блоков). «2018–2022» — срок программы, а не исследования.",
"Цифры 13 675, до 9% урожая и до 21% тяжёлых потерь (в районах с погодными шоками) подтверждены. «10%» из блога PxD в статье соответствует 9,6% снижения вероятности тяжёлых потерь в среднем."],
"added_evidence":[{"url":"https://precisiondev.org/wp-content/uploads/2025/02/Odisha_RCT_02052025.pdf","publisher":"рабочая статья (HBS, UMD, PxD)","published":"2025-02-05","origin":"academic","quote_original":"Disclosure: Cole is a board member of PxD, but does not receive any financial compensation from the organization. Harigaya and Zhu are employed by PxD.","quote_ru":"Раскрытие: Коул — член совета PxD, вознаграждения не получает. Харигая и Чжу работают в PxD."}],
"sources_opened":["https://precisiondev.org/wp-content/uploads/2025/02/Odisha_RCT_02052025.pdf"]}
],
"unchecked_entity_ids":[],
"packet_notes_ru":"Системные ошибки автора. (1) Точность диагностики в исследовании или ретроспективе (ТБ ЮАР, ДР Пенджаб) выдана за исход работы организации. В 120 такие случаи не засчитываются. (2) Независимость оценена по формальным признакам. Конфликты интересов пропущены или смягчены: JD.com — 7 из 9 авторов из компании, при этом дан уровень B; Ama Krushi — авторы из PxD, при этом дан уровень A. Самоизмерение компании в научной форме без внешнего подтверждения — уровень C. (3) Статистика пересказана неточно: в MASAI снижение интервального рака на 12% незначимо (ДИ 0,65–1,18), это non-inferiority. (4) Утверждения из неоткрытых источников (Samant 2026, Deloitte €35k, 12 707) записаны как факты. (5) Амстердам и Роттердам дублируют W7-EU-OTHER, а уровни и исходы расходятся с W7. После проверки к зачёту: MASAI (confirm) и Allegheny (B/mixed, needs_rework). Бюджет WebSearch: использовано 2 вызова из 3."
}
