{
 "packet_id": "W8-FIELD-WORK-6",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T15:55:00+03:00",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-6-01",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": true,
   "issues_ru": [
    "Уровень B подтверждён: предрегистрированное РКИ (OSF) на реальных сессиях FEV Tutor с учениками школ Title I; 4 из 5 авторов — Stanford без связи с FEV. Уточнение независимости: ведущий автор не только работала в FEV неполный день, но и сама строила Tutor CoPilot вместе с командами FEV (разработчик = исследователь). Данные (логи сессий, exit tickets) — от FEV, тесты NWEA MAP — от школьного округа. Для B достаточно, для A нет.",
    "quote_original второго утверждения не дословна. В тексте: «we did not find statistically significant improvements in end-of-year math test scores». Фразы «End-of-year math test scores showed no statistically significant improvements» на странице нет.",
    "«Освоение темы» измеряли по прохождению exit ticket: 62% → 66% (ITT, +4 п.п.); среди тьюторов, реально использовавших инструмент (TOT), 62% → 76% (+14 п.п.). Эффект на итоговые годовые тесты незначим — исход mixed верен.",
    "900 тьюторов и 1800 учеников — начальное распределение; из-за выбытия аналитическая выборка меньше (в версии EdWorkingPaper ~700 тьюторов и ~1000 учеников). Период: 27 марта — 17 мая 2024. Публикация: arXiv v1 — октябрь 2024, v2 — 26.01.2025, в окне.",
    "Автор не внёс финансовое число: стоимость API $1419,66 на 429 тьюторов за 2 месяца, то есть ≈$20 на тьютора в год. Пересчёт: 1419,66/429 = 3,31 за 2 мес; ×6 = $19,9 — совпадает."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/html/2410.03017",
     "publisher": "arXiv (Stanford)",
     "published": "2025-01-26 (v2)",
     "origin": "academic",
     "quote_original": "The main author of this study worked part-time with FEV Tutor, the tutoring provider, and collaborated closely with several teams (e.g., engineering, design, tutoring operations and curriculum teams) to build Tutor CoPilot",
     "quote_ru": "Ведущий автор исследования работала неполный день в FEV Tutor, тьюторской компании, и тесно сотрудничала с несколькими командами (инженерной, дизайна, тьюторских операций и учебных программ) при создании Tutor CoPilot"
    },
    {
     "url": "https://arxiv.org/html/2410.03017",
     "publisher": "arXiv (Stanford)",
     "published": "2025-01-26 (v2)",
     "origin": "academic",
     "quote_original": "we did not find statistically significant improvements in end-of-year math test scores",
     "quote_ru": "мы не обнаружили статистически значимого улучшения итоговых годовых оценок по математике"
    },
    {
     "url": "https://arxiv.org/html/2410.03017",
     "publisher": "arXiv (Stanford)",
     "published": "2025-01-26 (v2)",
     "origin": "academic",
     "quote_original": "The total API cost for 429 treatment tutors over the 2-month study was $1,419.66, resulting in an estimated annual cost of $20 per tutor.",
     "quote_ru": "Общие расходы на API для 429 тьюторов экспериментальной группы за 2 месяца составили $1419,66, то есть ≈$20 на тьютора в год"
    }
   ],
   "sources_opened": [
    "https://arxiv.org/html/2410.03017",
    "WebSearch: поздние публикации Tutor CoPilot (опровержений и откатов не найдено; есть версия EdWorkingPaper ai24-1054)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-6-02",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "A",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "A подтверждено: NFER — независимый оценщик по заказу EEF и Hg Foundation (не вендор ChatGPT). Школьно-рандомизированное РКИ: 259 учителей, 68 школ. EEF присвоил результату высокую оценку надёжности (high security rating). Отчёт открыт лично (ERIC ED680921), дата — декабрь 2024, в окне. NFER сам собирал данные и был их контролёром.",
    "Ошибка автора: он пишет, что время собрано «не по самоотчёту». Первичный исход (время подготовки) — самоотчёт учителей в еженедельном дневнике NFER (Questback), без ослепления условия. 18,5% учителей выбыли из основного анализа, в группе ChatGPT чуть больше. Это ограничение измерения; уровень A оно не отменяет, но записать его нужно.",
    "Ответ на вопрос координатора: качество ресурсов оценивала экспертная комиссия NFER, не знавшая, как созданы материалы. Оценивали выборку ресурсов, а не проведённые уроки. Успеваемость учеников не измерялась.",
    "Период данных: испытание — декабрь 2023 — декабрь 2024; внедрение — 10 недель летнего семестра 2024; первичный исход — недели 6–10. Пересчёт: 81,5−56,2 = 25,3 мин; 25,3/81,5 = 31,0%; 56,2/81,5 = 69% — совпадает.",
    "Единица наблюдения: школы-добровольцы; ChatGPT применялся к реальной подготовке уроков по назначению в рамках испытания. Это реальная работа, а не придуманное задание, но охват — часть расписания (в основном 1–2 активности на урок)."
   ],
   "added_evidence": [
    {
     "url": "https://files.eric.ed.gov/fulltext/ED680921.pdf",
     "publisher": "EEF / NFER (Evaluation Report)",
     "published": "2024-12",
     "origin": "independent",
     "quote_original": "This was measured via a workload question in a weekly teacher diary during the ten-week implementation period, in the summer term 2024.",
     "quote_ru": "Это измерялось вопросом о нагрузке в еженедельном дневнике учителя в течение десятинедельного периода внедрения, в летнем семестре 2024 года."
    },
    {
     "url": "https://files.eric.ed.gov/fulltext/ED680921.pdf",
     "publisher": "EEF / NFER (Evaluation Report)",
     "published": "2024-12",
     "origin": "independent",
     "quote_original": "Due to some participating teachers not completing the weekly diary data, 18.5% of teachers were not included in the primary analysis",
     "quote_ru": "Поскольку часть учителей не заполнила еженедельный дневник, 18,5% учителей не вошли в основной анализ"
    },
    {
     "url": "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/",
     "publisher": "NFER",
     "published": "2024-12-12",
     "origin": "independent",
     "quote_original": "from an expert panel review (who did not know how the resources had been created) of lesson resources sampled from each of the two groups",
     "quote_ru": "по оценке экспертной комиссии (не знавшей, как были созданы материалы) выборки учебных ресурсов из каждой из двух групп"
    }
   ],
   "sources_opened": [
    "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/",
    "https://files.eric.ed.gov/fulltext/ED680921.pdf",
    "https://educationendowmentfoundation.org.uk/... (Cloudflare challenge, не открыт)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-6-03",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "Полный текст открыт (EdWorkingPaper 22-564, версия от июня 2026). Авторы: из 11 пятеро — сотрудники GSU (Fifield, Tyson, Evans, Frost, Jung). Шестеро внешние: Meyer — Brookings, Page и Mata — Brown, Smith — UT Austin, Walsh — UCF, Eremionkhale — DePauw. Сотрудников Mainstay среди авторов нет. Данные — административные записи GSU и логи сообщений Mainstay, то есть одно происхождение, данные организации. Внешние авторы ведущие, их большинство, работа реальная, исследование предрегистрировано в REES (ID 8160, 13760) — B допустим, A нет.",
    "Это не Pounce студенческих сервисов, а курсовой чат-бот «TA Pounce» на платформе Mainstay. Он работал в двух асинхронных онлайн-курсах (American Government, Microeconomics) и рассылал сообщения от имени команды курса. Сами авторы называют бот «non-generative AI»; координатору стоит решить, подходит ли это к рамке AI-native.",
    "Метрики автора неверны. Пул двух курсов: вероятность оценки A или B +4 п.п. к 61% в контроле (≈+7%), а не «5–6 п.п.». После поправки на множественные сравнения эффект на оценку A незначим, на «B и выше» значим. «Снижение отсева» в пуле незначимо: DFW −3 п.п. только в Government (к 18%), отказ от курса −3 п.п. только в Microeconomics (к 8%). «+7» у женщин в микроэкономике — пункты числовой итоговой оценки, а не п.п. вероятности; A/B у женщин +11 п.п.",
    "Период данных (автор не установил): Government — осень 2021, весна 2022, осень 2022 (1568 студентов); Microeconomics — 2022/23 учебный год (915 студентов); пилот — весна 2021. Номер 22-564 означает, что первая версия вышла в 2022 году. Измерение с пулом по двум курсам опубликовано в версии от июня 2026 — окно выполнено по текущей версии, но более ранние версии содержали часть результатов.",
    "Пересчёт: 4/61 = 6,6% ≈ 7%; 4/36 = 11% — совпадает с текстом. Исход success допустим по предрегистрированной итоговой оценке и доле A/B; по DFW эффект частичный."
   ],
   "added_evidence": [
    {
     "url": "https://edworkingpapers.com/sites/default/files/ai22_564_v3.pdf",
     "publisher": "EdWorkingPapers / Annenberg Institute, Brown University",
     "published": "2026-06",
     "origin": "academic",
     "quote_original": "Treatment students are four percentage points more likely to earn an A relative to 36% of control-group students (about an 11% increase) and arere four percentage points more likely to earn an A or B relative to 61% of control-group students",
     "quote_ru": "Студенты экспериментальной группы на 4 п.п. чаще получали A при 36% в контроле (рост ≈11%) и на 4 п.п. чаще получали A или B при 61% в контроле"
    },
    {
     "url": "https://edworkingpapers.com/sites/default/files/ai22_564_v3.pdf",
     "publisher": "EdWorkingPapers / Annenberg Institute, Brown University",
     "published": "2026-06",
     "origin": "academic",
     "quote_original": "Overall, treated students are not significantly less likely to DFW or to drop the course relative to control students.",
     "quote_ru": "В целом студенты экспериментальной группы не имели значимо меньшей вероятности получить D/F/отчисление или бросить курс по сравнению с контрольной группой."
    },
    {
     "url": "https://edworkingpapers.com/sites/default/files/ai22_564_v3.pdf",
     "publisher": "EdWorkingPapers / Annenberg Institute, Brown University",
     "published": "2026-06",
     "origin": "academic",
     "quote_original": "Across the fall 2021, spring 2022, and fall 2022 academic semesters we randomized a total of 1,568 students enrolled in Government, and during the 2022-23 academic year, we randomized 915 students enrolled in Microeconomics.",
     "quote_ru": "В осенний семестр 2021, весенний 2022 и осенний 2022 мы рандомизировали 1568 студентов курса Government, а в 2022/23 учебном году — 915 студентов курса Microeconomics."
    }
   ],
   "sources_opened": [
    "https://edworkingpapers.com/ai22-564",
    "https://edworkingpapers.com/sites/default/files/ai22_564_v3.pdf",
    "https://niss.gsu.edu/digital-library/21790/ (Cloudflare block)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-6-04",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Ответ на вопрос координатора: оценивание шло на реальных тестах реальных курсов, это не придуманное задание. Но это не «4 университета». Все четыре курса вели в University of South Carolina: согласования IRB USC — один курс осенью 2023, остальные весной 2024. Другие аффилиации — текущие места работы соавторов.",
    "Паттерн Princeton: преподаватели-авторы сами разработали ИИ-оценивание, применили его в своих курсах, сами собрали данные и сами их проанализировали. Происхождение данных и анализа совпадает. Рецензирование PLOS One и предрегистрация на OSF независимость не создают. Уровень C, а не B.",
    "Урок 23.09 «точность ≠ исход»: основная метрика — различительная способность оценок ИИ против человека, то есть качество модели. Метрики работы организации (время и нагрузка преподавателей, пропускная способность) не измерялись. Доля апелляций мала: всего 1,41%, эффект авторы сами называют tiny. Исход работы не установлен — unknown.",
    "Дата публикации — 19.08.2025 (в окне), а не «2025/2026». Цитаты 1 и 3 дословны; цитата 2 обрезана (в тексте «Overall, human-graded cases...»), смысл сохранён."
   ],
   "added_evidence": [
    {
     "url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041",
     "publisher": "PLOS One",
     "published": "2025-08-19",
     "origin": "academic",
     "quote_original": "Ethical approval was given by the Institutional Review Board of the University of South Carolina for one class in Fall 2023 on September 7, 2023 (Pro00131778) and for the others in Spring 2024 on January 16, 2024 (Pro00134602).",
     "quote_ru": "Этическое одобрение дал IRB University of South Carolina: для одного курса осенью 2023 (7 сентября 2023) и для остальных весной 2024 (16 января 2024)."
    },
    {
     "url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041",
     "publisher": "PLOS One",
     "published": "2025-08-19",
     "origin": "academic",
     "quote_original": "At the start of the semester, each instructor explained our AI-assisted grading approach to students",
     "quote_ru": "В начале семестра каждый преподаватель объяснял студентам наш подход к оцениванию с помощью ИИ"
    }
   ],
   "sources_opened": [
    "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-6-05",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Вне окна. Статья вышла онлайн 31.08.2020 (Crossref, DOI 10.1080/10494820.2020.1808794); 2023 — дата печатного тома. Результаты SRI доложили на AERA ещё в 2019 году, данные собраны до этого. По правилу окна (дата публикации измерения) кейс не проходит.",
    "Оценка сделана по заказу вендора. SRI прямо пишет, что проводил для Yixue/Squirrel AI серию оценок, «демонстрирующих эффективность, ведущую к принятию рынком». Доклад на AERA 2019 делался «on behalf of Squirrel AI Learning». Двое соавторов — топ-менеджеры Squirrel AI. Происхождение ERIC-записи автор пометил как «independent» — ошибка; фактически это исследование вендора с привлечённым подрядчиком. Аффилиация Feng — WestEd, а не SRI.",
    "Единица наблюдения не та. Это эксперимент, организованный вендором и SRI (случайное распределение учеников по условиям), а не внедрение ИИ школой в свою работу. Исход — прирост знаний учеников по тесту, а не изменение работы учителей. Размер эффекта автор не установил; адаптивная система негенеративная.",
    "Ответы на вопросы координатора: SRI работал по заказу вендора — да; исход — обучение учеников, а не работа учителей."
   ],
   "added_evidence": [
    {
     "url": "https://www.sri.com/education-learning/edu-newsletter/artificial-intelligence-and-education-january-2022/",
     "publisher": "SRI International",
     "published": "2022-01",
     "origin": "company",
     "quote_original": "SRI Education has worked with Yixue/Squirrel AI to conduct a series of rapid, rigorous evaluations of its AI tutoring system—demonstrating efficacy that leads to market acceptance of lower cost/high-quality tutoring.",
     "quote_ru": "SRI Education работал с Yixue/Squirrel AI над серией быстрых строгих оценок её ИИ-системы репетиторства, демонстрирующих эффективность, ведущую к принятию рынком более дешёвого и качественного репетиторства."
    },
    {
     "url": "https://www.prnewswire.com/news-releases/squirrel-ai-learning-by-yixue-group-gives-a-thesis-presentation-at-the-aera-education-summit-on-innovative-educational-and-learning-styles-300875192.html",
     "publisher": "PR Newswire (релиз Squirrel AI Learning)",
     "published": "2019-06-26",
     "origin": "company",
     "quote_original": "gave a speech titled \"Putting Technology to the Test: Efficacy Studies of an Adaptive System in China \" on behalf of Squirrel AI Learning by Yixue Group",
     "quote_ru": "выступил с докладом «Putting Technology to the Test: Efficacy Studies of an Adaptive System in China» от имени Squirrel AI Learning by Yixue Group"
    },
    {
     "url": "https://api.crossref.org/works/10.1080/10494820.2020.1808794",
     "publisher": "Crossref (метаданные Taylor & Francis)",
     "published": "2020-08-31 (online), 2023-02-17 (print)",
     "origin": "independent",
     "quote_original": "published-online 2020-08-31; published-print 2023-02-17",
     "quote_ru": "онлайн-публикация 31.08.2020; печатный выпуск 17.02.2023 (поля метаданных, не текст статьи)"
    }
   ],
   "sources_opened": [
    "https://eric.ed.gov/?id=EJ1381588",
    "https://api.crossref.org/works/10.1080/10494820.2020.1808794",
    "https://www.sri.com/education-learning/edu-newsletter/artificial-intelligence-and-education-january-2022/",
    "https://www.prnewswire.com/news-releases/squirrel-ai-learning-by-yixue-group-gives-a-thesis-presentation-at-the-aera-education-summit-on-innovative-educational-and-learning-styles-300875192.html"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-6-06",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Цитата arXiv дословна, препринт от 15.02.2024 (v2 — 05.05.2024). Исход success — по самоотчёту разработчика; для зачёта неприменим. Единица — ИИ-репетитор для учеников как дополнительные занятия, изменение работы сотрудников не показано. Незачёт подтверждаю."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/abs/2402.09809"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-6-07",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "D",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Незачёт подтверждаю. Исследователи провели четыре 90-минутных занятия примерно в 50 классах (≈15% программы семестра) — это эксперимент исследователей, а не программа школы (прецедент Нацбанка Словакии). Уровень D здесь означает «вне рамки»; сам PNAS-РКИ по качеству измерения сильный.",
    "Нарушено правило дословности. Вторая quote_original («This was a purely experimental manipulation, not an adopted organizational program») на странице PMC отсутствует — это вывод автора, оформленный как цитата. Первая цитата склеена и искажена («performed a 17% reduction»). Исправить на дословные: «(48% improvement in grades for GPT Base and 127% for GPT Tutor)» и «(17% reduction in grades for GPT Base)».",
    "Дата: PNAS, 25.06.2025. Числа 48% / 127% / −17% подтверждены; эффект GPT Tutor на экзамене незначим (−0,004)."
   ],
   "added_evidence": [
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/",
     "publisher": "PNAS / PMC",
     "published": "2025-06-25",
     "origin": "academic",
     "quote_original": "We conducted four 90-min sessions for about fifty 9th, 10th, and 11th-grade classes, comprising nearly 1,000 students. For each grade, our sessions collectively comprised about 15% of the math curriculum covered during the semester.",
     "quote_ru": "Мы провели четыре 90-минутных занятия примерно в пятидесяти 9–11 классах, почти 1000 учеников. Для каждого класса наши занятия в сумме составили около 15% программы по математике за семестр."
    }
   ],
   "sources_opened": [
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-WORK-6-08",
  "W8-FIELD-WORK-6-09",
  "W8-FIELD-WORK-6-10"
 ],
 "packet_notes_ru": "WebSearch использован 3 раза из 10. Проверены все 5 предложенных в 120 (01–05), mixed-кейс 07 и выборочно 06 (1 из 4 оставшихся, ≥25%). Итог по 120: подтверждены 01 (B, mixed), 02 (A, success), 03 (B, success); 04 понижен до C, 05 снят с зачёта. Системные ошибки автора: (1) quote_original не дословны или сочинены (07 — выдуманная фраза; 01 — перефраз); (2) дата печатного тома вместо даты первой публикации (05: онлайн 2020 — вне окна); (3) независимость по составу авторов вместо происхождения данных и заказчика (05 — оценка по заказу вендора, помечена «independent»; 04 — преподаватели оценивают свой инструмент в своих курсах, паттерн Princeton); (4) метрики не по первоисточнику: в 03 «5–6 п.п.» вместо 4 п.п. и незначимое в пуле «снижение отсева»; в 02 самоотчётный дневник учителей выдан за «не самоотчёт»; (5) аффилиации соавторов приняты за места внедрения (04 — все курсы в USC). Период данных установлен: 01 — 27.03–17.05.2024; 02 — летний семестр 2024; 03 — осень 2021 — 2022/23; 04 — осень 2023 — весна 2024. Внешние запросы — curl с User-Agent «Mozilla/5.0», данные пользователя не передавались. Скачанные при проверке файлы удалены из папки пакета."
}