{
 "packet_id": "W8-FIELD-WORK-11",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T00:00:00Z",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-11-01",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Цитаты и числа подтверждены по лично открытому PDF GDS (8 с.) и пресс-релизу GOV.UK: 26 минут в день; «self reported»; 23% и 24% в Excel и PowerPoint; снижение в Word на 5% и в Outlook на 10% от пика; 7.7 и 8.2; 82%. Сноска пресс-релиза о самоотчёте дословно верна.",
    "Арифметика: 26 мин × ~250 дней / 480 мин ≈ 13.5 дня. В отчёте указано «13 days», расчёт по серединам интервалов, максимум ограничен 60 минутами. Совпадает.",
    "Уровень C подтверждён. GDS сама организовала эксперимент и собирала данные («GDS organised and ran...», «Data collection was centralised through GDS»). Контрольной группы нет, исход только самоотчётный. Центральный статус GDS не делает её независимым оценщиком, а для B методика v0.4 §7 требует подтверждения ключевого исхода другим независимым источником. Такого подтверждения нет.",
    "Пропущенное контрдоказательство. В рандомизированной оценке HMRC (опубликована 09.07.2026) получено около 60 минут в неделю по самоотчёту, а у GDS 26 минут в день (≈130 минут в неделю), то есть примерно вдвое меньше. HMRC прямо называет свою оценку более консервативной. Эффект в 26 минут в день не воспроизводится в другом ведомстве, это подкрепляет исход mixed. При этом данные HMRC частично вошли в отчёт GDS, поэтому это не полностью независимое происхождение.",
    "Отчёт DBT (сущность 02) не может служить вторым независимым подтверждением. DBT входит в число 12 ведомств эксперимента, а сам отчёт DBT пишет, что его выводы «not comparable to findings from other Government departments»."
   ],
   "added_evidence": [
    {
     "url": "https://www.gov.uk/government/publications/evaluation-report-phase-3-trial-of-microsoft-copilot/evaluating-the-impact-of-microsoft-copilot-in-hmrc",
     "publisher": "HM Revenue & Customs (GOV.UK)",
     "published": "2026-07-09",
     "origin": "company (другое ведомство того же правительства; данные HMRC частично вошли в отчёт GDS)",
     "quote_original": "Early results from HMRC also informed the report from Government Digital Service (GDS), who led a wider cross-government trial involving 11 participating departments.",
     "quote_ru": "Ранние результаты HMRC также использованы в отчёте Government Digital Service (GDS), которая руководила более широким межведомственным экспериментом с участием 11 ведомств."
    },
    {
     "url": "https://www.gov.uk/government/publications/evaluation-report-phase-3-trial-of-microsoft-copilot/evaluating-the-impact-of-microsoft-copilot-in-hmrc",
     "publisher": "HM Revenue & Customs (GOV.UK)",
     "published": "2026-07-09",
     "origin": "company",
     "quote_original": "on average, HMRC participants self-reported saving 2-3% of their working week, equating to around 60 minutes per week for a full-time equivalent working pattern",
     "quote_ru": "в среднем участники из HMRC по самоотчёту экономили 2–3% рабочей недели, то есть около 60 минут в неделю при полной занятости"
    }
   ],
   "sources_opened": [
    "https://assets.publishing.service.gov.uk/media/683db42bd23a62e5d32680d0/M365_Copilot_Experiment_Findings_Report.pdf",
    "https://www.gov.uk/government/news/landmark-government-trial-shows-ai-could-save-civil-servants-nearly-2-weeks-a-year",
    "https://www.gov.uk/government/publications/evaluation-report-phase-3-trial-of-microsoft-copilot/evaluating-the-impact-of-microsoft-copilot-in-hmrc"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-11-02",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Цитаты подтверждены по лично открытому PDF DBT (август 2025): 72%, NPS 31, отклик 32%, 1000 лицензий, 70/30 добровольцев и случайно отобранных, 19 интервью (13 участников + 6 из контрольной группы), фраза «did not find evidence that time savings have led to improved productivity». Оценку провела Digital Data and Technology Monitoring and Evaluation team самого DBT.",
    "Автор переоценил силу методики. Сам отчёт называет её «theory-based and evidence-without-a-counterfactual evaluation». Контрольная группа использовалась «only... for qualitative interviews and observed tasks». Замеров «до и после» нет. Наблюдаемые задания: 11 человек, 4 задачи, 3 против 3 и 3 против 2; авторы пишут «should be treated with caution». Количественного контрфактического сравнения нет, поэтому уровень B не заслужен даже по методике, независимо от статуса оценщика.",
    "Автор не привёл результаты наблюдаемых заданий (табл. 6), хотя они подкрепляют исход mixed. У пользователей Copilot анализ в Excel занял 25:01 против 20:33 у контрольной группы, точность и качество 1.5 против 2.7. В PowerPoint быстрее (10:47 против 18:30), но точность 1.5 против 5. В резюмировании отчётов быстрее и лучше (12:37 против 41:34).",
    "Арифметика: 1000 × 32% ≈ 320 респондентов, порядок величины верен."
   ],
   "added_evidence": [
    {
     "url": "https://assets.publishing.service.gov.uk/media/68adbe409e1cebdd2c96a19d/dbt-microsoft-365-copilot-evaluation.pdf",
     "publisher": "Department for Business and Trade (GOV.UK)",
     "published": "2025-08",
     "origin": "company",
     "quote_original": "This report covers the theory-based and evidence-without-a-counterfactual evaluation of M365 Copilot conducted by the Department for Business and Trade.",
     "quote_ru": "В отчёте описана основанная на теории оценка M365 Copilot без контрфактического сравнения, проведённая Department for Business and Trade."
    },
    {
     "url": "https://assets.publishing.service.gov.uk/media/68adbe409e1cebdd2c96a19d/dbt-microsoft-365-copilot-evaluation.pdf",
     "publisher": "Department for Business and Trade (GOV.UK)",
     "published": "2025-08",
     "origin": "company",
     "quote_original": "The control group was only utilised for qualitative interviews and observed tasks, meaning comparisons to non-users are limited.",
     "quote_ru": "Контрольная группа использовалась только для качественных интервью и наблюдаемых заданий, поэтому сравнение с неиспользующими ограничено."
    }
   ],
   "sources_opened": [
    "https://assets.publishing.service.gov.uk/media/68adbe409e1cebdd2c96a19d/dbt-microsoft-365-copilot-evaluation.pdf"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-11-04",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Числа подтверждены по лично открытому PDF i.AI от 27.08.2025: 87 738 ответов, 125 рецензентов, 73% против 65%, F1 0.816 против 0.710, «no evidence of bias». Проверка суммы: 17 000 (двойное рецензирование) + 70 738 (одиночное) = 87 738, сходится.",
    "Уровень C подтверждён. Оценщик i.AI является разработчиком Consult. Все найденные дополнительные оценки (Scottish Government, Independent Water Commission, DSIT) проведены той же i.AI. Страница rebootdemocracy.ai теперь открывается (HTTP 200), но это обзорный пересказ отчёта i.AI, то есть то же происхождение.",
    "Методологическая оговорка, которую автор не отметил. Рецензенты не размечали ответы вслепую, а оценивали уже проставленную разметку Consult («two reviewers independently judged the mapping that Consult had provided»). Поэтому 73% «без изменений» — это доля принятых решений ИИ с возможным эффектом привязки к подсказке, а сравнение с согласием двух людей (65%) несимметрично: оба рецензента видели одну и ту же разметку Consult.",
    "Исход success относится к качеству разметки модели, а не к измеренному изменению работы DWP. Экономия времени и денег в отчёте не измерена (урок 23.09: точность модели ≠ исход работы организации). Если сущность когда-либо пойдёт на повышение уровня, исход нужно переформулировать как «точность соответствует человеческому уровню; эффект на работу не измерен».",
    "Статья The Canary от 26.03.2026 о том, что ответы на консультацию DWP по PIP будут анализироваться ИИ, закрыта проверкой Cloudflare. Обходить её не стали, ссылка записана в unreachable. К тому же это ангажированное СМИ и отдельная консультация, поэтому на вердикт она не влияет."
   ],
   "added_evidence": [
    {
     "url": "https://assets.publishing.service.gov.uk/media/68f63fe01c9076042263f0bd/evaluation-report.pdf",
     "publisher": "Incubator for AI (GOV.UK)",
     "published": "2025-08-27",
     "origin": "company",
     "quote_original": "In the first ‘double review’ phase, two reviewers independently judged the mapping that Consult had provided for a sample of 1000 responses for each of the 17 questions in the consultation.",
     "quote_ru": "На первом этапе «двойного рецензирования» два рецензента независимо оценивали разметку, которую Consult предложил для выборки из 1000 ответов по каждому из 17 вопросов консультации."
    }
   ],
   "sources_opened": [
    "https://assets.publishing.service.gov.uk/media/68f63fe01c9076042263f0bd/evaluation-report.pdf",
    "https://rebootdemocracy.ai/blog/uk-ai-consult-eval/"
   ],
   "unreachable": [
    "https://www.thecanary.co/uk/analysis/2026/03/26/dwp-pip-review-consultation/"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-WORK-11-03",
  "W8-FIELD-WORK-11-05",
  "W8-FIELD-WORK-11-06",
  "W8-FIELD-WORK-11-07",
  "W8-FIELD-WORK-11-08",
  "W8-FIELD-WORK-11-09",
  "W8-FIELD-WORK-11-10",
  "W8-FIELD-WORK-11-11"
 ],
 "packet_notes_ru": "Выборочно проверены 3 из 11 сущностей (27%), выбраны самые сильные по методике. Обязательных к проверке нет: ни одна сущность не предложена в 120, уровней A/B нет, финансовых чисел нет. Mixed-исход у 6 сущностей, проверены 2 из них (01, 02), остальные — в unchecked. Ответ на главный вопрос: уровень C подтверждён для всех трёх, повышения до B нет. Причин две. (1) По методике v0.4 §7 уровень B требует подтверждения ключевого исхода независимым источником другого происхождения. Центральный статус оценщика (GDS, i.AI) этого не заменяет: GDS организовала эксперимент, i.AI разработала Consult. Evaluation Task Force, NAO и академические группы ни в одной из трёх оценок не участвовали и отдельно их не проверяли. (2) Сильная методика здесь переоценена: у DBT количественного контрфактического сравнения нет (так написано в самом отчёте), контрольная группа использовалась только для 6 интервью и 5 наблюдаемых заданий; в Consult рецензенты видели готовую разметку ИИ. Логика выше не зависит от конкретного правительства: если ведомство проводит оценку с рандомизированной контрольной группой и объективными метриками, а ключевой исход подтверждает независимый орган или вторая оценка на других данных, то уровень B допустим. В этом пакете такого сочетания нет. Системных ошибок автора не найдено: цитаты дословны, числа и арифметика верны. Замечания: автор завышает описание методики DBT, пропускает оговорку о привязке рецензентов к подсказке в Consult и не находит контрдоказательство HMRC. Для координатора: оценка HMRC и VOA (GOV.UK, 09.07.2026; 3000 лицензий распределены случайно, по самоотчёту около 60 минут в неделю, прогноз около £50 млн в год) может стать новой сущностью, вероятный уровень C. Вызовов WebSearch: 3 (лимит 5). Файлы открыты через curl с User-Agent «Mozilla/5.0» и через WebFetch; временная папка vtmp удалена. Капчи, пейволлы и блокировки не обходились. Страница thecanary.co закрыта проверкой Cloudflare и записана в unreachable. User-Agent «Mozilla/5.0» использовался только по требованию не передавать данные пользователя, а не для обхода блокировок."
}