{
 "packet_id": "W8-FIELD-OPS-17",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T13:20:00Z",
 "entities": [
  {
   "entity_id": "W8-FIELD-OPS-17-01",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "Реальные пациенты, не виньетки: 128 взрослых пациентов отделения внутренней медицины Helios Wuppertal рандомизированы 1:1, LLM-эпикриз (GPT-4o) получали реальные выписываемые пациенты после проверки лечащим врачом. Цифры аннотации совпадают: 64/64, разница медиан Ходжеса-Лемана 9,6 балла PAM-13 [95% ДИ 4,3–15,1], p=0,0009; Lancet Digital Health, первая публикация 18.05.2026 (у автора — «июнь 2026»).",
    "Исход — активация пациента (PAM-13, самоотчёт пациента сразу при выписке) — это исход процесса выписки, а не время врачей, качество текста по оценке экспертов или ошибки. Время врачей на подготовку и правку черновиков, частота ошибок и галлюцинаций LLM, повторные госпитализации в исследовании не измерялись (в реестре DRKS вторичные исходы — грамотность в вопросах здоровья и оценка письма самими пациентами). Роль ИИ в изменении работы есть: LLM + проверка врачом встроены в выписку для группы вмешательства.",
    "Понижено с A до B: полный текст в Lancet Digital Health закрыт (в Europe PMC есть только аннотация, полного текста в PMC нет), проверено по аннотации и регистрационной записи DRKS00035739; одно РКИ, один центр, одно происхождение данных (авторы — Witten/Herdecke, финансирование от университета — это подтверждается). Сами авторы указывают, что до рутинного внедрения нужны дальнейшие исследования (обеспечение качества, защита данных, регулирование). Это испытание, а не решение больницы о внедрении.",
    "Засчитать можно по аналогии с UCSD (РКИ на реальной работе), но с пометкой: суррогатный исход, измеренный при выписке, без измерения нагрузки на врачей. Опровержений, писем в редакцию и откатов в Europe PMC не найдено (цитирований пока 0)."
   ],
   "added_evidence": [
    {
     "url": "https://www.drks.de/search/en/trial/DRKS00035739",
     "publisher": "German Clinical Trials Register (BfArM)",
     "published": "2024-12/2025 (запись реестра)",
     "origin": "регистрационная запись спонсора Witten/Herdecke University",
     "quote_original": "Primary outcome: Patient Activation Measure (PAM-13) Secondary outcome: Health literacy (HLS-EU-16) Perceived usefulness, comprehensibility, empathy, trust and satisfaction of discharge letters (measured with self-developed 5-point Likert scales)",
     "quote_ru": "Первичный исход — PAM-13; вторичные — грамотность в вопросах здоровья (HLS-EU-16) и оценка пользы, понятности, эмпатии, доверия и удовлетворённости письмами (собственные 5-балльные шкалы)."
    },
    {
     "url": "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=EXT_ID:42150962&format=json&resultType=core",
     "publisher": "Europe PMC (аннотация статьи в The Lancet Digital Health)",
     "published": "2026-05-18",
     "origin": "авторы РКИ (Witten/Herdecke University)",
     "quote_original": "LLM outputs were reviewed by the treating physician.",
     "quote_ru": "Результаты LLM проверял лечащий врач."
    }
   ],
   "sources_opened": [
    "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=EXT_ID:42150962&format=json&resultType=core",
    "https://www.drks.de/search/en/trial/DRKS00035739",
    "https://www.ebi.ac.uk/europepmc/webservices/rest/MED/42150962/citations?format=json"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-17-02",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Ретроспективное слепое сравнение текстов: 72 выписки за одну 8-часовую смену 03.04.2024; для каждой GPT-4 задним числом сгенерировал альтернативное письмо, и 17 оценщиков сравнили письма попарно. GPT-4-письма пациентам не выдавались, рабочий процесс Sheba не менялся. Это прецедент «оценка качества текстов/точность модели ≠ исход работы» (как виньетки), даже несмотря на то, что исходные данные настоящие.",
    "Цифры подтверждены: 1009 против 197 (83,7%, p<0,001; 1009/1206=83,66%), эмпатия 4,0 против 3,0; медицинская точность L2 5,0 против L1 4,0, p=0,025 (оценивали 3 старших врача ED). Финансирования и конфликтов интересов нет. Соавторы Klang, Nadkarni, Glicksberg — из Icahn School of Medicine at Mount Sinai (не вендор).",
    "Внутреннее противоречие у автора: в counter_evidence_ru прямо сказано, что письма не выдавались пациентам и это не изменение работы, но сущность предложена в 120 с уровнем A и исходом success. Для организации исход unknown; уровень B относится к качеству самого исследования текстов, а не к исходу работы."
   ],
   "added_evidence": [
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12615915/",
     "publisher": "Digital Health (SAGE), через Europe PMC/PMC",
     "published": "2025-11-13",
     "origin": "авторы Sheba Medical Center / Tel Aviv University",
     "quote_original": "We conducted a retrospective, blinded, comparative study in a tertiary ED. All patients discharged for one 8-h shift were included. For each patient, we compared the original ED discharge letter to a GPT-4 generated letter.",
     "quote_ru": "Мы провели ретроспективное слепое сравнительное исследование в ED третичного уровня: включены все пациенты, выписанные за одну 8-часовую смену; для каждого пациента исходное выписное письмо сравнивалось с письмом, сгенерированным GPT-4."
    }
   ],
   "sources_opened": [
    "https://www.ebi.ac.uk/europepmc/webservices/rest/PMC12615915/fullTextXML"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-17-03",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Реальные пациенты не участвовали: 53 случайно отобранные выписные инструкции (реальные тексты врачей) переведены задним числом (53×3 языка×3 метода=477 — арифметика верна) и оценены профессиональными медицинскими переводчиками вслепую. Понимание инструкций пациентами, ошибки приёма лекарств и повторные обращения не измерялись; машинный перевод в рабочий процесс MGH/BWH не внедрялся. Это точность модели, а не исход работы (урок 23.09).",
    "Цифры аннотации подтверждены: не хуже по адекватности, смыслу и тяжести ошибок (испанский, португальский) и по всем 4 доменам (китайский); хуже по беглости для испанского и португальского; частота клинически значимых ошибок между методами значимо не различалась. Как оценка модели результат смешанный, но для организации исход unknown.",
    "Уровень A не заслужен: полный текст в Wiley закрыт, в Europe PMC только аннотация (полного текста в PMC нет); одно происхождение данных. Публикация: Academic Emergency Medicine, 01.04.2026, DOI 10.1111/acem.70289. Цитирований и опровержений пока нет."
   ],
   "added_evidence": [
    {
     "url": "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=EXT_ID:41989065&format=json&resultType=core",
     "publisher": "Europe PMC (аннотация, Academic Emergency Medicine)",
     "published": "2026-04-01",
     "origin": "авторы MGH/BWH/MGB Digital",
     "quote_original": "Fifty-three randomly selected provider-written instructions (100-500 words, preserving spelling/grammar errors) were translated, yielding 477 unique translations. Professional medical interpreters, blinded to translation method, independently scored each translation",
     "quote_ru": "Переведены 53 случайно отобранные инструкции, написанные врачами, — всего 477 переводов; профессиональные медицинские переводчики, не знавшие метода перевода, независимо оценили каждый перевод."
    }
   ],
   "sources_opened": [
    "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=EXT_ID:41989065&format=json&resultType=core",
    "https://www.ebi.ac.uk/europepmc/webservices/rest/MED/41989065/citations?format=json"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-17-04",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Проверено кратко: в Europe PMC по-прежнему только препринт PPR927359 (17.10.2024), рецензируемой версии не найдено. Это ретроспективная оценка модели без внедрения: исход unknown и незачёт в 120 верны. Уровень B для непроверенного препринта о точности модели завышен — понижено до C."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=%22ICD-10-CM%22%20AND%20%22retrieval%22%20AND%20Klang%20AND%20emergency&format=json"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-17-05",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Выгорание не измерялось, хотя оно есть в названии статьи: ни опроса, ни шкал выгорания, ни когнитивной нагрузки нет. Измерены только доля использования черновика (38%) и время ответа на одно сообщение по журналам аудита Epic (от последнего просмотра до отправки). Поэтому это не прецедент Stanford (B: одна группа, измерены и время, и выгорание).",
    "Время измерено по журналам, в отличие от UCHealth, но сравнение методически слабое: внутри одного периода сравниваются сообщения, где пользователь сам выбрал черновик, с сообщениями без него. Нет ни рандомизации, ни сравнения до/после, ни контроля сложности сообщений. Авторы сами признают смешение: черновик могли брать для «простых» сообщений; кроме того, есть отбор пользователей (возможность выйти из пилота). Роль ИИ в экономии времени поэтому не установлена.",
    "Числа: в целом 179 против 192 с (−13 с, p<0,05; ≈6,8%); вспомогательный персонал 169 против 193 с — в тексте результатов −24,0 с, в аннотации 23 с (автор взял 23); у клиницистов 187 против 191 с, −4,0 с (в аннотации 3 с), незначимо; у пульмонологов время выросло (+185 с). Исход mixed подтверждаю.",
    "Итог: наблюдательный пилот с одним происхождением данных и сравнением, в котором не устранено смешение, → C, в 120 не засчитывать (ближе к UCHealth, чем к Stanford). Финансирования нет, конфликтов не заявлено; Epic — партнёр по внедрению, но не соавтор. Поздних опровержений в Europe PMC нет (6 цитирований, среди них нет повторных измерений в CHOP)."
   ],
   "added_evidence": [
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12328029/",
     "publisher": "Applied Clinical Informatics (Thieme), PMC",
     "published": "2025-04-08",
     "origin": "авторы CHOP",
     "quote_original": "One possible confounding factor in decreasing average response time is that users may utilize ART for relatively “simple” messages and refrain from using ART for more complex messages.",
     "quote_ru": "Один из возможных смешивающих факторов в снижении среднего времени ответа: пользователи могли применять ART для относительно «простых» сообщений и не применять его для более сложных."
    },
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12328029/",
     "publisher": "Applied Clinical Informatics (Thieme), PMC",
     "published": "2025-04-08",
     "origin": "авторы CHOP",
     "quote_original": "Comparisons in total reply time based on draft utilization were done by examining the total reply time when ART was used and the total reply time when ART was not used.",
     "quote_ru": "Общее время ответа сравнивалось между случаями, когда ART использовался и когда не использовался."
    }
   ],
   "sources_opened": [
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC12328029/",
    "https://www.ebi.ac.uk/europepmc/webservices/rest/search?query=PMCID:PMC12328029&format=json&resultType=core",
    "https://www.ebi.ac.uk/europepmc/webservices/rest/MED/40199518/citations?format=json"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-17-07",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Запись ClinicalTrials.gov NCT06263855 подтверждена: overallStatus WITHDRAWN, whyStopped «We are no longer going to evaluate the intervention.», спонсор Mayo Clinic, PI Xiaoxi Yao, последнее обновление 30.01.2026. Изменения работы не было, исход unknown; называть это «нулевым результатом» внедрения можно только как отказ от оценки, а не как измеренный провал."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://clinicaltrials.gov/api/v2/studies/NCT06263855"
   ]
  },
  {
   "entity_id": "W8-FIELD-OPS-17-08",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Цифры подтверждены: около 15 788 сотрудников, 2149 (13,6%) запросили доступ; 52,8% хотя бы раз использовали инструмент, 33,6% ни разу не вошли; 92 респондента из 461 устойчивых пользователя сообщили о среднем приросте продуктивности на 30%. Раскрыто финансирование от OpenAI несвязанных работ.",
    "Автор пропустил финансовое число из статьи: «exploratory perceived productivity value of $6.3M to $18.9M» — это экстраполяция самооценки, а не измеренный эффект; в metrics её вносить нельзя. Дату охвата лучше указывать точно: 01.12.2023–31.01.2025. Уровень C, mixed и незачёт — по прецеденту UCHealth (доля использования и опрос)."
   ],
   "added_evidence": [
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC13585266/",
     "publisher": "PMC",
     "published": "2026",
     "origin": "авторы Boston Children's Hospital",
     "quote_original": "a subset who responded to a self-report survey (n = 92) indicated a mean productivity gain of 30%, corresponding to an exploratory perceived productivity value of $6.3M to $18.9M under varying extrapolation assumptions.",
     "quote_ru": "Подгруппа, ответившая на опрос с самооценкой (n=92), указала средний прирост продуктивности на 30%, что соответствует поисковой оценке воспринимаемой ценности продуктивности от 6,3 до 18,9 млн долл. при разных допущениях экстраполяции."
    }
   ],
   "sources_opened": [
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC13585266/"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-OPS-17-06"
 ],
 "packet_notes_ru": "Фактически вызовов WebSearch — 0 (бюджет ≤6 не использовался). Все проверки выполнены обычными запросами к Europe PMC REST, PMC, DRKS и ClinicalTrials.gov API с нейтральным User-Agent «Mozilla/5.0», без данных пользователя. Пейволлы (Lancet Digital Health, Wiley AEM) не обходились — проверено по аннотациям. Системная ошибка автора: исследования точности и качества текстов с настоящими исходными данными, но без изменения работы (Sheba — письма пациентам не выдавались; MGB — переводы оценивали эксперты, до пациентов они не доходили), размечены как A/success/в 120 — это нарушает урок 23.09 «точность модели ≠ исход работы». Ещё одна системная ошибка: уровень A ставится по аннотации закрытой статьи. По CHOP автор не заметил, что выгорание не измерялось и что сравнение времени смешано отбором сообщений. Итог по 120: из 4 предложенных засчитывается 1 (01 Helios, B/success); 02 и 03 — reject_counting; 05 понижено до C/mixed без зачёта. Проверено 7 из 8; из четырёх непредложенных (04, 06, 07, 08) проверены 04, 07 и 08 (08 обязательно как mixed); 06 не проверялась."
}