{
 "packet_id": "W8-FIELD-WORK-10",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T13:30:00Z",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-10-01",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Роль ИИ не подтверждена. По разделу 2 статьи адаптивность ElimuLeo — детерминированное правило ветвления: при входе ступенчатый тест из 5 вопросов (верно — класс выше, неверно — ниже), затем блоки по 5 задач: не менее 4 из 5 — переход на следующий уровень «класс-четверть», 0 из 5 — на предыдущий. Задачи генерируются по шаблону (случайные Z и Y в x − Z = Y). ML или модели нет. Это тот же случай, что и отклонённый Ama Krushi того же PxD: роль ИИ не подтверждена.",
    "Нет организации, которая изменила свою работу. Это прямой бесплатный SMS-сервис для семей: приглашены пользователи агросервиса PxD, учителя и школы не участвуют. Прецедент Penda (изменилась работа клиник) неприменим. Исход — прохождение классов детьми по словам родителей; это не исход работы организации-поставщика.",
    "Цитаты дословны, числа 0.11 класса, ≈57% и 96.9% совпадают со стр. результатов (табл. 7). Дизайн — два РКИ, измерение внешнее: телефонный опрос IPA. Но баллы по математике берутся из данных платформы PxD, где исход наблюдается только у пользователей; авторы сами называют это эндогенным. Прохождение классов и посещаемость — со слов родителей. Уровень B для самого исследования приемлем, но для учёта это не важно.",
    "Утверждение автора в counter_evidence_ru о том, что после поправки на смещение оценка «скорее сместится к нулю», в тексте не найдено как вывод авторов; отношу его к интерпретации исполнителя.",
    "Финансирование оценки частично шло через Development Innovation Lab (UChicago). Аффилиации с PxD по тексту статьи не выявлены; организационная связь DIL и PxD не проверялась."
   ],
   "added_evidence": [
    {
     "url": "https://edworkingpapers.com/sites/default/files/ai23-791.pdf",
     "publisher": "EdWorkingPapers, Annenberg Institute at Brown University",
     "published": "2023-06-14",
     "origin": "academic",
     "quote_original": "If they complete at least four out of five correctly, they advance to the next grade-term level. If they are unable to complete any correctly, they move down to the preceding grade-term level.",
     "quote_ru": "Если ученик верно решает не менее четырёх из пяти задач, он переходит на следующий уровень «класс-четверть». Если не решает ни одной, он опускается на предыдущий уровень."
    },
    {
     "url": "https://edworkingpapers.com/sites/default/files/ai23-791.pdf",
     "publisher": "EdWorkingPapers, Annenberg Institute at Brown University",
     "published": "2023-06-14",
     "origin": "academic",
     "quote_original": "Math skills are measured using data from performance on the ElimuLeo platform post-intervention.",
     "quote_ru": "Математические навыки измеряются по результатам работы на платформе ElimuLeo после вмешательства."
    }
   ],
   "sources_opened": [
    "https://edworkingpapers.com/sites/default/files/ai23-791.pdf",
    "https://poverty-action.org/impact-sms-based-adaptive-math-learning-tool-educational-outcomes-kenya (только в результатах поиска)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-10-02",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Статья открыта целиком: открытая версия BJET в репозитории Cambridge, DOI 10.1111/bjet.13533, получена 27.10.2023, принята 11.10.2024. Трое из шести авторов (Khagame, Mumbi, Njuguna) указаны с аффилиацией «M-Shule, Nairobi»: половина авторов — сотрудники внедренца. Исполнитель этого не заметил.",
    "Одно происхождение данных: авторы делали вторичный анализ уже собранных данных — оценок и серверных логов, собранных по условиям использования платформы и переданных команде. Обезличивание указано; кто проводил телефонные тесты, не сказано. По урокам 23.09 (данные компании плюс анализ при участии её сотрудников — одно происхождение) это C, а не B.",
    "Роль ИИ не подтверждена. Статья описывает адаптацию так: результат квиза определяет переход к следующему блоку, более трудный или более лёгкий контент. Это правило ветвления, слов AI или ML в описании нет. Метка «AI-платформа» в research.json — формулировка исполнителя.",
    "Число 0.181 LAYS есть только на странице EdTech Hub (цитата дословна). Сама статья прямо говорит, что из-за разных шкал на входе и выходе метрику LAYS применить нельзя. Она даёт другие числа: 0.46 SD (5.20 против 4.56 при SD 1.38; пересчёт: 0.64/1.38 = 0.464, совпадает), отношение шансов 2.677 и $22.70 за SD. Между первоисточником и пересказом противоречие.",
    "Малая выборка: 94 ученика в группе вмешательства и 85 в контроле на выходе. Отсев 26%. Из первичной выборки в 500 номеров 37% оказались неактивны, и выборку добирали. Выборка разрежена: 51.8% ячеек нулевые.",
    "Нет организации, изменившей свою работу. Участники — ученики 1–3 классов из существующей базы M-Shule, контент Tusome переложен в SMS как «booster». Утверждение из human_role_ru, что учителя и координаторы Tusome распределяли доступ, в статье не подтверждено.",
    "Период известен: логи с 15.12.2020 по 27.02.2022, входной тест — сентябрь 2021, выходной — ноябрь–декабрь 2021. У исполнителя написано «не уточнён»."
   ],
   "added_evidence": [
    {
     "url": "https://www.repository.cam.ac.uk/bitstreams/b0b28c1d-26ab-4745-ad39-c270161d0444/download",
     "publisher": "British Journal of Educational Technology (Wiley/BERA), open-access copy in Apollo, University of Cambridge",
     "published": "2024-11 (online)",
     "origin": "academic",
     "quote_original": "For the secondary analysis of preexisting data (learning evaluation and server logs), the collection of data for analysis had been part of the terms and conditions of platform use.",
     "quote_ru": "Для вторичного анализа уже существующих данных (оценки обучения и серверные логи) их сбор был частью условий использования платформы."
    },
    {
     "url": "https://www.repository.cam.ac.uk/bitstreams/b0b28c1d-26ab-4745-ad39-c270161d0444/download",
     "publisher": "British Journal of Educational Technology (Wiley/BERA), open-access copy in Apollo, University of Cambridge",
     "published": "2024-11 (online)",
     "origin": "academic",
     "quote_original": "The mean average endline score for the control group is 4.56, with a standard deviation of 1.38. The mean average endline score for the treatment group is 5.20; therefore, the treatment effect is 0.64, which translates into a 0.46 standard deviation gain.",
     "quote_ru": "Средний итоговый балл контрольной группы — 4.56 при стандартном отклонении 1.38. Средний итоговый балл группы вмешательства — 5.20; эффект вмешательства — 0.64, то есть прирост на 0.46 стандартного отклонения."
    }
   ],
   "sources_opened": [
    "https://www.repository.cam.ac.uk/items/a7be9de1-9b53-4948-814e-d950b2fd66c8",
    "https://www.repository.cam.ac.uk/bitstreams/b0b28c1d-26ab-4745-ad39-c270161d0444/download",
    "https://edtechhub.org/case-study/low-tech-personalised-learning-to-improve-girls-education-in-kenya/"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-10-03",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Разработчики оценивают собственный инструмент без контроля — прецедент Princeton и PLOS. Авторы пишут прямо: «We designed, deployed, and evaluated Shiksha Copilot». Пятеро из девяти авторов — из Microsoft Research India, разработчика. Cornell — соисследователь того же проекта, работа поддержана Global Cornell. Независимость авторов из Cornell не даёт независимого происхождения данных (урок 23.09).",
    "Время и стресс — самоотчёт, а не измерение. До и после проведены опросы в Qualtrics через WhatsApp-группы менторов из команды внедрения. Ответов: 601 до и 406 после, анализ по 406 из 1043. Экономия «2.02 часа в неделю» (σ = 4.1) — оценка самих учителей. Стресс снизился на 0.72 пункта по 7-балльной шкале Лайкерта (d = −0.436). Контрольной группы нет, эффект новизны и отбор ответивших не исключены.",
    "Работа учителей госшкол действительно изменилась: планы нужны для отчётности и для уроков, учителей подбирали чиновники штата. Роль LLM (RAG плюс кураторы) реальна. Не хватает независимого измерения исхода.",
    "Фактическая ошибка в level_basis_ru: «1043 государственных школах». По статье — 1043 учителя из 757 школ в 35 округах.",
    "Цитаты склеены через «...» из разных мест: в утверждении 1 — аннотация и введение, в утверждении 3 — введение (с. 3) и аннотация. Фрагменты по отдельности дословны, но единой цитатой не являются."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2507.00456",
     "publisher": "Proc. ACM Hum.-Comput. Interact. (CSCW), arXiv v3",
     "published": "2026-03-11 (arXiv v3); journal 2026-04",
     "origin": "academic",
     "quote_original": "We designed, deployed, and evaluated Shiksha Copilot, a human-in-the-loop AI system to support teachers create curriculum-aligned, contextual lesson plans (LPs) in English and their local language.",
     "quote_ru": "Мы спроектировали, развернули и оценили Shiksha Copilot — систему ИИ с участием человека, помогающую учителям создавать соответствующие программе и контексту поурочные планы на английском и местном языке."
    },
    {
     "url": "https://arxiv.org/pdf/2507.00456",
     "publisher": "Proc. ACM Hum.-Comput. Interact. (CSCW), arXiv v3",
     "published": "2026-03-11 (arXiv v3); journal 2026-04",
     "origin": "academic",
     "quote_original": "We received 601 complete responses for the pre-survey and 406 for the post-survey; analyses were conducted on the 406",
     "quote_ru": "Мы получили 601 полный ответ на входной опрос и 406 на итоговый; анализ проведён по 406."
    }
   ],
   "sources_opened": [
    "https://arxiv.org/pdf/2507.00456",
    "https://arxiv.org/abs/2507.00456 (результат поиска)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-10-04",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Цитаты из playbook проверены и дословны: двухрукавный дизайн, примерно 50% времени, изоляция Oxford MeasurEd. Playbook подтверждает, что Fab AI и Google DeepMind «jointly spearheaded the overall research and impact evaluation design»: оценку ведёт вендор, поэтому C, не в 120. Согласен с исполнителем.",
    "Чисел 0.258 и 0.380 SD в playbook нет, они взяты только из пересказа EdTech Innovation Hub. Итоговый отчёт LearnLM/Fab AI я не открывал. Если сущность будут пересматривать, числа нужно сверить с первичным отчётом.",
    "Пересчёт Φ(0.258) ≈ 0.602 верен."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://storage.googleapis.com/deepmind-media/LearnLM/learnLM_sierraleone_playbook_jun26.pdf"
   ]
  }
 ],
 "unchecked_entity_ids": [],
 "packet_notes_ru": "Фактическое число вызовов WebSearch — 2 (лимит 10). Проверены все 4 сущности. Системные ошибки исполнителя: (1) адаптивные SMS-сервисы с правилом ветвления (ElimuLeo, M-Shule) засчитаны как «ИИ», хотя по первоисточникам это детерминированные правила; прецедент Ama Krushi того же PxD говорит против. (2) Прямые сервисы для семей засчитаны как изменение работы организации, но школы и учителя в них не участвуют. (3) Не проверены аффилиации авторов: трое из шести авторов статьи о M-Shule — сотрудники M-Shule; в Shiksha Copilot авторы сами спроектировали, развернули и оценили инструмент. (4) Самоотчёт учителей подан как «измеримое снижение»; число из вторичного пересказа (0.181 LAYS) противоречит первоисточнику. (5) Цитаты склеены из разных мест через «...». Итог: ни одна сущность пакета не засчитывается в 120 (было предложено 3). Черновики (PDF и тексты первоисточников) лежат в packets/W8-FIELD-WORK-10/drafts/."
}