{
 "packet_id": "W8-FIELD-WORK-6",
 "executor": "claude-sonnet subagent",
 "finished_at": "2026-09-23T15:26:30+03:00",
 "status": "submitted",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-6-01",
   "label_ru": "FEV Tutor (тьюторская компания, США) — Tutor CoPilot: РКИ ИИ-ассистента для живых онлайн-тьюторов, работающих с учениками школ Title I",
   "evidence_level": "B",
   "level_basis_ru": "Предрегистрированное на OSF РКИ на реальных сессиях FEV Tutor. Из 5 авторов (Wang, Ribeiro, Robinson, Loeb, Demszky — все Stanford) ведущий автор Rose Wang работала неполный день в FEV Tutor (частичное совпадение происхождения данных и анализа), остальные четверо — независимые исследователи без трудовых отношений с компанией. Соответствует прецеденту «большинство внешних авторов + реальная работа → B допустим»; не A, так как полной независимости происхождения данных нет.",
   "outcome": "mixed",
   "outcome_basis_ru": "Цель — рост освоения учениками тем по математике на реальных тьюторских сессиях; база — контрольная группа тьюторов без Tutor CoPilot; период — конец марта — май 2024 (2 месяца), 900 тьюторов, 1800 учеников. Результат: +4 п.п. вероятности освоения темы в целом (p<0.01), +9 п.п. у тьюторов с низким рейтингом; но по итоговым годовым тестам по математике и опросным метрикам учеников (интерес к пониманию, mindset, оценка сессии) статистически значимых эффектов не найдено. Разнонаправленные результаты → mixed.",
   "primary_category": "process_restructuring",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Рост вероятности освоения темы, общий эффект",
     "value": "+4",
     "unit": "п.п. (p<0.01)",
     "period": "март–май 2024",
     "baseline": "контрольная группа тьюторов без Tutor CoPilot",
     "source_url": "https://arxiv.org/html/2410.03017"
    },
    {
     "name_ru": "Рост вероятности освоения темы, тьюторы с низким рейтингом",
     "value": "+9",
     "unit": "п.п.",
     "period": "март–май 2024",
     "baseline": "контрольная группа",
     "source_url": "https://arxiv.org/html/2410.03017"
    }
   ],
   "claims": [
    {
     "claim_ru": "РКИ показало рост вероятности освоения математических тем учениками на 4 п.п. при доступе тьюторов к Tutor CoPilot (p<0.01).",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://arxiv.org/html/2410.03017",
       "title": "Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise",
       "publisher": "arXiv (Stanford)",
       "published": "2024-10",
       "origin": "academic",
       "quote_original": "4 percentage points (p.p.) more likely to master topics",
       "quote_ru": "на 4 процентных пункта выше вероятность освоения тем"
      }
     ]
    },
    {
     "claim_ru": "По итоговым годовым тестам по математике и опросным метрикам учеников статистически значимых эффектов не обнаружено.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://arxiv.org/html/2410.03017",
       "title": "Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise",
       "publisher": "arXiv (Stanford)",
       "published": "2024-10",
       "origin": "academic",
       "quote_original": "End-of-year math test scores showed no statistically significant improvements",
       "quote_ru": "итоговые оценки по математике за год не показали статистически значимых улучшений"
      }
     ]
    },
    {
     "claim_ru": "Ведущий автор исследования работала по совместительству в FEV Tutor — тьюторской компании, на данных которой проведено РКИ; остальные четверо авторов — независимые исследователи Стэнфорда без трудовых отношений с FEV Tutor.",
     "status": "VERIFIED",
     "what_verified": "publication",
     "evidence": [
      {
       "url": "https://arxiv.org/html/2410.03017",
       "title": "Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise",
       "publisher": "arXiv (Stanford)",
       "published": "2024-10",
       "origin": "academic",
       "quote_original": "worked part-time with FEV Tutor, the tutoring provider",
       "quote_ru": "работала неполный рабочий день в FEV Tutor, тьюторской компании-провайдере"
      }
     ]
    }
   ],
   "arithmetic": [],
   "counter_evidence_ru": "Тьюторы отмечали, что подсказки CoPilot иногда были не по уровню класса («too smart»), требуя упрощения; субгрупповой анализ показал убывающий эффект для более опытных/высокорейтинговых тьюторов.",
   "alternative_explanations_ru": "Часть эффекта могла объясняться эффектом простого внимания/вовлечённости от нового инструмента (эффект Хоторна), а не именно качеством ИИ-подсказок.",
   "human_role_ru": "Тьюторы (люди) вели сессии как обычно; ИИ выступал ассистентом/суфлёром в реальном времени, предлагая формулировки наводящих вопросов на основе экспертного мышления — решение о применении оставалось за тьютором.",
   "timeline_ru": "Предрегистрация на OSF до анализа данных; РКИ — март–май 2024 (2 месяца); препринт arXiv — октябрь 2024.",
   "limitations_ru": "Краткосрочность (2 месяца); частичная связь ведущего автора с тьюторской компанией; отсутствие эффекта на итоговые тесты и мотивационные показатели; долгосрочное удержание учеников/тьюторов не оценивалось.",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень B (преregistрация, большинство авторов независимы, реальная тьюторская организация), исход установлен как смешанный (успех по мастерству, ноль по итоговым тестам), роль ИИ в изменении процесса тьюторства прозрачна.",
   "sources_opened": [
    "https://arxiv.org/abs/2410.03017",
    "https://arxiv.org/html/2410.03017"
   ],
   "unreachable": [
    "https://nssa.stanford.edu/sites/default/files/Tutor%20CoPilot.pdf (бинарный PDF, не распарсен)"
   ],
   "company": "FEV Tutor (тьюторская компания, США)",
   "country": "США",
   "process": "Работа онлайн-тьюторов в реальном времени: формулирование наводящих вопросов ученикам во время сессий",
   "period": "март–май 2024",
   "region": "US"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-02",
   "label_ru": "68 государственных средних школ Англии (KS3, естественные науки) — «ChatGPT in Lesson Preparation: A Teacher Choices Trial»: школьно-рандомизированное РКИ, независимая оценка NFER по заказу EEF и Hg Foundation",
   "evidence_level": "A",
   "level_basis_ru": "Школьно-рандомизированное РКИ; независимая оценка проведена NFER (National Foundation for Educational Research) — организацией, не разрабатывавшей ChatGPT и не аффилированной со школами-участницами; данные о времени планирования и экспертная оценка качества уроков (слепая к условию) собраны оценщиком напрямую, а не по самоотчёту школ. Первичный документ лично открыт (страница NFER).",
   "outcome": "success",
   "outcome_basis_ru": "Цель — сократить время учителей на подготовку уроков без потери качества; метрика — среднее время подготовки в неделю (мин) и слепая экспертная оценка качества ресурсов; база — контрольная группа без GenAI; период — недели 6–10 десятинедельного РКИ летом 2024, 259 учителей 7–8 классов, 68 школ. Результат: 56,2 против 81,5 мин/нед (–25,3 мин, –31%), качество ресурсов не отличалось по независимой слепой экспертной оценке — цель достигнута без потери качества.",
   "primary_category": "process_restructuring",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Время подготовки уроков в неделю, группа ChatGPT",
     "value": "56.2",
     "unit": "мин/нед",
     "period": "недели 6–10, лето 2024",
     "baseline": "81.5 мин/нед в контрольной группе",
     "source_url": "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/"
    },
    {
     "name_ru": "Сокращение времени подготовки уроков",
     "value": "31",
     "unit": "%",
     "period": "лето 2024",
     "baseline": "контрольная группа",
     "source_url": "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/"
    }
   ],
   "arithmetic": [
    {
     "expr": "(81.5-56.2)/81.5*100",
     "result": "31.04%",
     "matches_source": true
    },
    {
     "expr": "56.2/81.5*100",
     "result": "68.96% (≈69%)",
     "matches_source": true
    }
   ],
   "claims": [
    {
     "claim_ru": "Время подготовки уроков и материалов у учителей группы ChatGPT было на 25,3 минуты в неделю меньше, чем в контрольной группе (–31%).",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/",
       "title": "ChatGPT in Lesson Preparation: A Teacher Choices Trial",
       "publisher": "NFER",
       "published": "2024",
       "origin": "independent",
       "quote_original": "The lesson and resource preparation time spent by the ChatGPT group was 69% of the time spent by the non-GenAI group in weeks six to ten",
       "quote_ru": "Время подготовки уроков и материалов в группе ChatGPT составило 69% от времени контрольной группы (без генеративного ИИ) на неделях 6–10"
      }
     ]
    },
    {
     "claim_ru": "Независимая экспертная комиссия, не знавшая об условии, не выявила различий в качестве уроков между группами.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/",
       "title": "ChatGPT in Lesson Preparation: A Teacher Choices Trial",
       "publisher": "NFER",
       "published": "2024",
       "origin": "independent",
       "quote_original": "We found no evidence to suggest that the quality of the lesson resources used by the two groups differed, from an expert panel review.",
       "quote_ru": "Мы не нашли свидетельств того, что качество ресурсов урока в двух группах различалось, по оценке экспертной комиссии."
      }
     ]
    }
   ],
   "counter_evidence_ru": "Влияние на успеваемость учеников не измерялось — известно только о времени учителей и качестве материалов по оценке экспертов, а не по реальным урокам в классе.",
   "alternative_explanations_ru": "Учителя экспериментальной группы могли использовать сэкономленное время не для повышения качества, а для другой нагрузки; эффект специфичен для предмета (естественные науки KS3, 7–8 классы) и мог не воспроизвестись в других предметах/этапах.",
   "human_role_ru": "Учителя сохраняли полный контроль над использованием ChatGPT (модель «teacher choices» — учитель сам решает, что и как применять) и итоговое редактирование материалов; ИИ не заменял учителя, использовался выборочно (в среднем для трети уроков).",
   "timeline_ru": "10-недельное РКИ летом 2024; публикация NFER/EEF — 2024; последующих откатов или повторных проверок программы в рамках бюджета поиска не найдено.",
   "limitations_ru": "Один предмет (естественные науки), один этап (KS3), одна страна (Англия); нет данных о влиянии на успеваемость учеников; страницы EEF (educationendowmentfoundation.org.uk) были недоступны (403), использована публикация NFER.",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень A (независимый оценщик NFER, лично открытый первичный документ, прозрачное измерение, слепая экспертная оценка), исход установлен (успех по цели: время сокращено без потери качества), роль ИИ в изменении процесса подготовки уроков прозрачна и измерена независимо.",
   "sources_opened": [
    "https://www.nfer.ac.uk/publications/chatgpt-in-lesson-preparation-a-teacher-choices-trial/"
   ],
   "unreachable": [
    "https://educationendowmentfoundation.org.uk/projects-and-evaluation/projects/choices-in-edtech-using-generative-ai-chatgpt-for-ks3-science-lesson-preparation-2024-teacher-choices-trial (403)",
    "https://educationendowmentfoundation.org.uk/news/teachers-using-chatgpt-alongside-a-guide-to-support-them-to-use-it-effectively-can-cut-lesson-planning-time-by-over-30-per-cent (403)"
   ],
   "company": "68 государственных средних школ Англии; независимый оценщик — NFER; заказчики — Education Endowment Foundation и Hg Foundation",
   "country": "Великобритания",
   "process": "Подготовка уроков и учебных материалов учителями (планирование, создание вопросов/квизов, адаптация материалов под группы)",
   "period": "лето 2024 (10 недель)",
   "region": "OTHER"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-03",
   "label_ru": "Georgia State University (National Institute for Student Success) — «Let's Chat»: предрегистрированное РКИ ИИ-чат-бота (Pounce/Mainstay) для поддержки студентов вводных курсов политологии и экономики",
   "evidence_level": "B",
   "level_basis_ru": "Предрегистрированное РКИ на реальных вводных курсах GSU. Ведущие исследователи серии (Lindsay C. Page, Katharine Meyer) не являются сотрудниками GSU, но часть соавторов — сотрудники National Institute for Student Success самой GSU (C. Lindsey Fifield, Michelle Tyson, Amy Eremionkhale, Michael Evans, Shelby Frost, Eye Eoun Jung), а данные принадлежат GSU/вендору Mainstay. Соответствует прецеденту «большинство внешних авторов + реальная работа + внедрение → B», но не A из-за неполной независимости происхождения данных.",
   "outcome": "success",
   "outcome_basis_ru": "Цель — повышение успеваемости и снижение отсева через текстовые ИИ-напоминания в двух вводных курсах; метрика — доля студентов с итоговой оценкой B или выше и отсев курса; база — контрольная группа без чат-бота. Результат: рост вероятности оценки B+ на 5–6 п.п., снижение отсева; для женщин в курсе микроэкономики — рост итоговой оценки на 7 п.п. Точный учебный год не подтверждён личным прочтением полного текста (PDF и SSRN недоступны).",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Рост вероятности итоговой оценки B или выше",
     "value": "5–6",
     "unit": "п.п.",
     "period": "вводные курсы политологии и экономики, GSU",
     "baseline": "контрольная группа без чат-бота",
     "source_url": "https://edworkingpapers.com/ai22-564"
    },
    {
     "name_ru": "Рост итоговой оценки у женщин в курсе микроэкономики",
     "value": "7",
     "unit": "п.п.",
     "period": "курс микроэкономики",
     "baseline": "контрольная группа",
     "source_url": "https://edworkingpapers.com/ai22-564"
    }
   ],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "РКИ показало, что ИИ-чат-бот увеличил итоговые оценки и вовлечённость студентов в академическую поддержку (например, тьюторство).",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://edworkingpapers.com/ai22-564",
       "title": "Let's Chat: Leveraging Chatbot Outreach for Improved Course Performance",
       "publisher": "EdWorkingPapers / Annenberg Institute",
       "published": "после 2023 (точная дата не подтверждена)",
       "origin": "academic",
       "quote_original": "chatbot messaging increased students' final grades and engagement with academic supports, such as tutoring",
       "quote_ru": "рассылки чат-бота повысили итоговые оценки студентов и вовлечённость в академическую поддержку, например тьюторство"
      }
     ]
    },
    {
     "claim_ru": "Для женщин в курсе микроэкономики итоговая оценка в группе с чат-ботом была на 7 п.п. выше, чем в контрольной группе.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://edworkingpapers.com/ai22-564",
       "title": "Let's Chat: Leveraging Chatbot Outreach for Improved Course Performance",
       "publisher": "EdWorkingPapers / Annenberg Institute",
       "published": "после 2023",
       "origin": "academic",
       "quote_original": "treated women in a Microeconomics course, who earned final grades that were seven percentage points higher than women in the control group",
       "quote_ru": "у женщин в группе с чат-ботом в курсе микроэкономики итоговые оценки были на семь процентных пунктов выше, чем у женщин контрольной группы"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Само исследование описывает бот как «non-generative AI» (система классификации намерений/правил, не генеративная LLM); эффект специфичен по курсам/полу — данные по мужчинам и другим курсам не приведены в открытых фрагментах; нет данных о долгосрочном удержании после окончания курса.",
   "alternative_explanations_ru": "Дополнительное внимание/контакт со стороны университета (эффект простого напоминания) могло объяснять часть эффекта, а не именно ИИ-персонализация; данные предоставлены самой GSU, часть соавторов — штатные сотрудники NISS GSU.",
   "human_role_ru": "Сотрудники NISS GSU и партнёр Mainstay настраивали контент и логику бота; преподаватели курсов не заменялись — бот дополнял очное преподавание точечными напоминаниями и ответами на вопросы по курсу.",
   "timeline_ru": "Продолжение серии РКИ Pounce/GSU (2016 — приёмная кампания, 2018–2019 — удержание) до данного исследования по вводным курсам; точный год сбора данных не подтверждён личным прочтением полного текста.",
   "limitations_ru": "Не удалось открыть полный PDF (ошибка парсинга бинарного файла) и SSRN-страницу (403) для проверки точного года, размера выборки и деталей преregistрации; сведения взяты из открытых html-описаний на edworkingpapers.com и niss.gsu.edu.",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень B (ведущие внешние исследователи, реальное внедрение в вводных курсах, неполная независимость происхождения данных от GSU), исход — установленный успех по конкретным метрикам (доля B+, отсев).",
   "sources_opened": [
    "https://niss.gsu.edu/digital-library/21790/",
    "https://edworkingpapers.com/ai22-564"
   ],
   "unreachable": [
    "https://edworkingpapers.com/sites/default/files/ai22-564.pdf (бинарный, не распарсен)",
    "https://www.ssrn.com/abstract=5449607 (403)",
    "https://doi.org/10.2139/ssrn.5449607 (редирект, не открыт)"
   ],
   "company": "Georgia State University (National Institute for Student Success); вендор чат-бота — Mainstay (ранее AdmitHub)",
   "country": "США",
   "process": "Проактивная поддержка студентов вводных курсов: текстовые напоминания о заданиях и ресурсах, ответы на вопросы по курсу",
   "period": "не подтверждён точно в открытых источниках (после 2023, по данным EdWorkingPaper ai22-564)",
   "region": "US"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-04",
   "label_ru": "Университеты Хьюстона, Южной Каролины, Academia Sinica (Тайвань), Kangwon National (Корея) и Мичигана — предрегистрированное РКИ ИИ-ассистированного оценивания коротких ответов студентов в курсах политологии",
   "evidence_level": "B",
   "level_basis_ru": "Преподаватели-исследователи сами разработали и применили ИИ-оценивание в своих реальных курсах и сами опубликовали результат в рецензируемом журнале PLOS One — паттерн близок к «разработчик оценивает свой инструмент на своих студентах» (как в кейсе Princeton), но здесь это шесть независимых преподавателей из пяти разных университетов и стран без общего вендора, с открытой предregistрацией на OSF (13 января 2024) — происхождение данных распределено между несколькими независимыми организациями. Рецензирование PLOS One — дополнительная внешняя проверка методологии. Уровень B, не A: оценщики и исследователи — одни и те же лица.",
   "outcome": "mixed",
   "outcome_basis_ru": "Цель — сравнить ИИ- и ручное оценивание коротких ответов по точности (дискриминации оценки), частоте апелляций и субъективной полезности отзыва; база — рандомизация на уровне ответов внутри теста; период — 2023/2024 уч. год, 271 студент, 26 тестов, 3080 ответов на короткие вопросы. Результат: точность ИИ и человека статистически не различалась (разница –0.04, SE 0.03, незначимо); ИИ-оценки реже оспаривались (общая доля апелляций 1.41%), но восприятие полезности отзыва разнилось по курсам (в одних курсах выше у человека, в других — у ИИ). Разнонаправленные показатели → mixed; авторы прямо пишут, что влияние на обучение не измерялось.",
   "primary_category": "process_restructuring",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Различие в дискриминации оценки (ИИ минус человек), пул выборки",
     "value": "-0.04",
     "unit": "условные ед. (SE 0.03, незначимо)",
     "period": "2023/2024 уч. год",
     "baseline": "человеческое оценивание",
     "source_url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041"
    },
    {
     "name_ru": "Общая доля запросов на пересдачу/апелляцию",
     "value": "1.41",
     "unit": "%",
     "period": "2023/2024 уч. год",
     "baseline": "—",
     "source_url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041"
    }
   ],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "Различие в точности (дискриминации) между ИИ- и человеческим оцениванием было статистически незначимым и практически ничтожным.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041",
       "title": "AI-assisted grading and personalized feedback in large political science classes: Results from randomized controlled trials",
       "publisher": "PLOS One",
       "published": "2025/2026 (точная дата выпуска не извлечена)",
       "origin": "academic",
       "quote_original": "In the pooled sample, we find that AI discriminates more than a human grader on average. However, the difference is not significant (mean: −0.04, SE: 0.03) and the magnitude is miniscule.",
       "quote_ru": "В объединённой выборке ИИ в среднем различает работы сильнее, чем человек-оценщик, но разница незначима (среднее: −0.04, SE: 0.03) и ничтожна по величине"
      }
     ]
    },
    {
     "claim_ru": "Работы, оценённые человеком, чаще оспаривались студентами, чем оценённые ИИ, хотя эффект небольшой.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041",
       "title": "AI-assisted grading and personalized feedback in large political science classes: Results from randomized controlled trials",
       "publisher": "PLOS One",
       "published": "2025/2026",
       "origin": "academic",
       "quote_original": "Human-graded cases are more likely to result in regrade requests compared to AI-graded cases (mean: 0.93, SE: 0.16). However, the effect size is tiny.",
       "quote_ru": "Работы, оценённые человеком, чаще приводят к запросам на пересдачу, чем оценённые ИИ (среднее: 0.93, SE: 0.16), однако величина эффекта мала"
      }
     ]
    },
    {
     "claim_ru": "Авторы прямо указывают, что исследование не измеряло влияние на реальные результаты обучения студентов.",
     "status": "VERIFIED",
     "what_verified": "none",
     "evidence": [
      {
       "url": "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041",
       "title": "AI-assisted grading and personalized feedback in large political science classes: Results from randomized controlled trials",
       "publisher": "PLOS One",
       "published": "2025/2026",
       "origin": "academic",
       "quote_original": "This study demonstrates the potential of LLMs to mimic instructor grading, but it does not directly assess student learning outcomes and critical thinking skills.",
       "quote_ru": "Исследование демонстрирует потенциал LLM имитировать оценивание преподавателя, но не оценивает напрямую результаты обучения студентов и навыки критического мышления"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Восприятие полезности отзыва разнилось по курсам: в некоторых классах человеческая обратная связь оценивалась значимо выше ИИ (mean 2.13, SE 0.64), что противоречит однозначно позитивной трактовке результата.",
   "alternative_explanations_ru": "Дизайн сравнивает ИИ с тщательным ручным оцениванием «с большим вниманием», а не с типичной практикой большого класса — сами авторы называют это «phantom counterfactual» (фантомным контрфактом), что ограничивает обобщаемость на обычную нагрузку преподавателя.",
   "human_role_ru": "Преподаватели сами формулировали критерии, часть ответов оценивали вручную (контроль), часть — с помощью ИИ с последующей проверкой; итоговое решение по спорным случаям оставалось за преподавателем.",
   "timeline_ru": "Предрегистрация OSF — 13 января 2024; сбор данных — 2023/2024 уч. год; публикация в PLOS One (точная дата выпуска статьи не извлечена из открытого фрагмента).",
   "limitations_ru": "Авторы — сами преподаватели курсов, они же оценщики и исследователи (совпадение происхождения данных и анализа); не измерялось влияние на обучение; неясно точное распределение курсов по странам (США/Тайвань/Корея).",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень B (преregistрация, рецензируемый журнал, несколько независимых организаций-авторов, но совпадение роли преподавателя и исследователя), исход установлен как смешанный, роль ИИ в изменении процесса оценивания прозрачна.",
   "sources_opened": [
    "https://journals.plos.org/plosone/article?id=10.1371%2Fjournal.pone.0328041"
   ],
   "unreachable": [],
   "company": "Кафедры политологии University of Houston, University of South Carolina, Academia Sinica (Тайвань), Kangwon National University (Корея), University of Michigan",
   "country": "США (основные курсы); соавторы — Тайвань, Республика Корея",
   "process": "Оценивание письменных ответов студентов (коротких вопросов) преподавателями/ассистентами во вводных курсах политологии",
   "period": "2023/2024 учебный год",
   "region": "US"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-05",
   "label_ru": "Squirrel AI Learning (Yixue Education Group, Китай) совместно с SRI International — два квазиэкспериментальных исследования эффективности ИИ-адаптивного обучения математике против группового/малогруппового обучения учителем в школах двух провинций Китая",
   "evidence_level": "B",
   "level_basis_ru": "Опубликовано в рецензируемом журнале Interactive Learning Environments (2023). Из 7 авторов (Wang Shuai, Claire Christensen, Wei Cui, Richard Tong, Louise Yarnall, Linda Shear, Mingyu Feng) двое — руководители компании-разработчика (Cui — сооснователь и главный научный сотрудник, Tong — главный архитектор Squirrel AI/Yixue), остальные пятеро — исследователи вне штата компании, включая сотрудников SRI International (независимого исследовательского института США). Соответствует прецеденту «большинство внешних авторов + реальная работа → B допустим»; не A из-за соавторства и, вероятно, финансирования со стороны компании.",
   "outcome": "success",
   "outcome_basis_ru": "Цель — сравнить прирост баллов по математике у восьмиклассников при индивидуализированном адаптивном обучении Squirrel AI против группового и малогруппового обучения под руководством опытных учителей; база — случайное распределение учеников по условиям в двух провинциях Китая; период — публикация 2023 (точный учебный год сбора данных не извлечён из доступного фрагмента ERIC). Результат: ученики в условии Squirrel AI показали больший прирост баллов по математике, чем в обоих контрольных условиях.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Прирост баллов по математике, Squirrel AI vs. обучение экспертным учителем",
     "value": "выше в условии Squirrel AI (точная величина эффекта не извлечена из доступного фрагмента)",
     "unit": "качественное сравнение",
     "period": "публикация 2023",
     "baseline": "группа с обучением экспертным учителем (whole-class и small-group)",
     "source_url": "https://eric.ed.gov/?id=EJ1381588"
    }
   ],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "Восьмиклассники, случайно направленные на обучение с Squirrel AI Learning, показали больший прирост по математическому тесту, чем ученики, случайно направленные на групповое или малогрупповое обучение под руководством опытных учителей.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://eric.ed.gov/?id=EJ1381588",
       "title": "When Adaptive Learning Is Effective Learning: Comparison of an Adaptive Learning System to Teacher-Led Instruction",
       "publisher": "ERIC / Interactive Learning Environments",
       "published": "2023",
       "origin": "independent",
       "quote_original": "showed greater gains on a mathematics test than those randomly assigned to whole-class or small-group instruction led by expert teachers",
       "quote_ru": "показали больший прирост по математическому тесту, чем ученики, случайно направленные на групповое или малогрупповое обучение под руководством опытных учителей"
      }
     ]
    },
    {
     "claim_ru": "Среди семи авторов исследования двое — руководители компании-разработчика Squirrel AI/Yixue, остальные пятеро — независимые исследователи, в т.ч. сотрудники SRI International.",
     "status": "VERIFIED",
     "what_verified": "publication",
     "evidence": [
      {
       "url": "https://eric.ed.gov/?id=EJ1381588",
       "title": "When Adaptive Learning Is Effective Learning",
       "publisher": "ERIC",
       "published": "2023",
       "origin": "independent",
       "quote_original": "Wang, Shuai; Christensen, Claire; Cui, Wei; Tong, Richard; Yarnall, Louise; Shear, Linda; Feng, Mingyu",
       "quote_ru": "Ван Шуай; Клэр Кристенсен; Вэй Цуй; Ричард Тонг; Луиз Ярналл; Линда Шир; Минюй Фэн"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Точные величины эффекта (effect size, доверительные интервалы, p-значения), число участников и провинции не удалось извлечь из доступного фрагмента ERIC — полный текст в Interactive Learning Environments (Taylor & Francis), ResearchGate и academia.edu был недоступен (403).",
   "alternative_explanations_ru": "Соавторство и, вероятно, финансирование со стороны компании-разработчика создают риск конфликта интересов в интерпретации результатов; неизвестно, учитывался ли эффект новизны технологии (novelty effect) у учеников.",
   "human_role_ru": "В контрольных группах «expert teachers» вели традиционное групповое/малогрупповое обучение; в экспериментальной группе роль учителя сводится к сопровождению индивидуальной работы ученика с адаптивной системой (модель Squirrel AI «учитель-фасилитатор»).",
   "timeline_ru": "Публикация в Interactive Learning Environments, vol. 31, no. 2, pp. 793–803, 2023.",
   "limitations_ru": "Не удалось лично открыть полный текст статьи (только аннотацию через ERIC); неизвестны величина эффекта, статистическая значимость, число участников и провинции; двое из семи авторов связаны с компанией-разработчиком.",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень B (большинство внешних авторов при участии соразработчиков, рецензируемый журнал), исход — установленный успех по направлению эффекта, хотя точная величина не подтверждена личным прочтением полного текста (указано как ограничение).",
   "sources_opened": [
    "https://eric.ed.gov/?id=EJ1381588"
   ],
   "unreachable": [
    "https://www.tandfonline.com/doi/abs/10.1080/10494820.2020.1808794 (403)",
    "https://www.researchgate.net/publication/344010541 (403)",
    "https://www.academia.edu/112172350 (403)"
   ],
   "company": "Squirrel AI Learning by Yixue Education Group (Китай); независимые соавторы — SRI International (США)",
   "country": "Китай",
   "process": "Обучение математике в школе: замена части группового/индивидуального обучения учителем на адаптивную ИИ-систему с учителем-фасилитатором",
   "period": "2023 (публикация; учебный год сбора данных не подтверждён)",
   "region": "CN"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-06",
   "label_ru": "Rising Academies (Гана) — пилотное исследование ИИ-репетитора по математике Rori (WhatsApp) в 11 школах: самооценка компании через штатного продакт-менеджера; независимое полномасштабное РКИ анонсировано, но результатов ещё нет",
   "evidence_level": "C",
   "level_basis_ru": "Ведущий автор пилотного исследования (Owen Henkel) занимает должность Product Manager в Rising Academies — организации-разработчике и операторе Rori (лично подтверждено на странице LEVI), то есть исследователь и разработчик — одна организация. Это самоотчёт компании о собственном продукте, несмотря на формат научного препринта. Независимое полномасштабное РКИ с внешним экономистом (Edward Asiedu, University of Ghana Business School, не связан с Rising Academies) анонсировано при поддержке J-PAL North America, но на дату проверки числится в статусе планирования цикла 2025/26 учебного года — результатов нет.",
   "outcome": "success",
   "outcome_basis_ru": "По самоотчёту компании: цель — прирост успеваемости по математике; метрика — стандартизированный тест роста навыков; база — контрольные школы; период — 8 месяцев, 2023–2024, около 1000 учеников 3–9 классов, 11 школ (рандомизация на уровне школы). Результат (самоотчёт, не подтверждён независимо): величина эффекта 0.36–0.37 SD, p<0.001.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Величина эффекта на прирост баллов по математике (год 1, самоотчёт)",
     "value": "0.36–0.37",
     "unit": "SD",
     "period": "8 месяцев, 2023–2024",
     "baseline": "контрольные школы без Rori",
     "source_url": "https://arxiv.org/abs/2402.09809"
    }
   ],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "Ученики, получившие доступ к Rori (2 сессии по 30 минут в неделю сверх обычных уроков), показали статистически значимо более высокий прирост по математике (эффект 0.36–0.37 SD, p<0.001) по собственным данным Rising Academies.",
     "status": "SOURCE_CLAIM",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://arxiv.org/abs/2402.09809",
       "title": "Effective and Scalable Math Support: Evidence on the Impact of an AI-Tutor on Math Achievement in Ghana",
       "publisher": "arXiv (соавторы Rising Academies)",
       "published": "2024-02",
       "origin": "company",
       "quote_original": "an effect size of 0.37, and that the results were statistically significant (p < 0.001)",
       "quote_ru": "величина эффекта 0.37, результаты статистически значимы (p < 0.001)"
      }
     ]
    },
    {
     "claim_ru": "Ведущий автор пилотного исследования — штатный продакт-менеджер компании Rising Academies, оператора Rori.",
     "status": "VERIFIED",
     "what_verified": "publication",
     "evidence": [
      {
       "url": "https://learning-engineering-virtual-institute.org/teams/rising-academy-network/",
       "title": "Rising Academy Network team page",
       "publisher": "Learning Engineering Virtual Institute",
       "published": "2024/2025",
       "origin": "company",
       "quote_original": "Product Manager, Rising Academies",
       "quote_ru": "Продакт-менеджер, Rising Academies"
      }
     ]
    },
    {
     "claim_ru": "Независимое полномасштабное РКИ (45 школ, около 8100 учеников, рандомизация на уровне класса) с участием внешнего экономиста Edward Asiedu (University of Ghana) анонсировано, но на дату проверки остаётся предложенным/начинающимся исследованием без опубликованных результатов.",
     "status": "SOURCE_CLAIM",
     "what_verified": "none",
     "evidence": [
      {
       "url": "https://www.povertyactionlab.org/initiative-project/scaling-ai-powered-math-tutoring-across-diverse-educational-contexts-full-scale",
       "title": "Scaling AI-Powered Math Tutoring Across Diverse Educational Contexts: A Full-Scale RCT in Ghana",
       "publisher": "J-PAL (Abdul Latif Jameel Poverty Action Lab)",
       "published": "2025",
       "origin": "academic",
       "quote_original": "recruit 45 schools in Ghana, with an anticipated sample of 8,100 students, using classroom-level randomization",
       "quote_ru": "набрать 45 школ в Гане с ожидаемой выборкой 8100 учеников, используя рандомизацию на уровне класса"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Авторы пилотного исследования сами пишут, что результаты «следует интерпретировать осторожно», поскольку это лишь первый год работы программы.",
   "alternative_explanations_ru": "Дополнительные 2 занятия в неделю сверх обычных уроков сами по себе (любое дополнительное учебное время, не обязательно ИИ) могли объяснить часть прироста; рандомизация на уровне школы при 11 школах даёт малое число кластеров и риск смещения по школьным характеристикам.",
   "human_role_ru": "Учебный процесс организован как дополнительные внеурочные занятия в дополнение к обычным урокам, которые продолжают вести штатные учителя; Rori работает как отдельный ИИ-репетитор через WhatsApp, а не как ассистент учителя в классе.",
   "timeline_ru": "Пилот — 8 месяцев в течение 2023–2024 уч. года (препринт arXiv — февраль 2024); полномасштабное РКИ анонсировано на 2025/26 уч. год, результатов на 23.09.2026 не найдено.",
   "limitations_ru": "Самоотчёт компании-разработчика через штатного продакт-менеджера; независимое подтверждение отсутствует; малое число кластеров рандомизации (11 школ); фокус на прямом ИИ-репетиторстве учеников, а не на изменении работы сотрудников Rising Academies как таковой.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C: ведущий автор — сотрудник компании-оператора продукта, независимое подтверждение отсутствует на дату проверки; ожидается независимое полномасштабное РКИ (J-PAL/Asiedu, University of Ghana).",
   "sources_opened": [
    "https://arxiv.org/abs/2402.09809",
    "https://www.povertyactionlab.org/initiative-project/scaling-ai-powered-math-tutoring-across-diverse-educational-contexts-full-scale",
    "https://learning-engineering-virtual-institute.org/teams/rising-academy-network/"
   ],
   "unreachable": [],
   "company": "Rising Academies (тьюторская/образовательная компания, Западная Африка)",
   "country": "Гана",
   "process": "Дополнительное репетиторство по математике для школьников через WhatsApp-бот в рамках организационной программы тьюторской компании",
   "period": "пилот — 2023–2024 (8 месяцев); полномасштабное РКИ — 2025/26",
   "region": "OTHER"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-07",
   "label_ru": "Крупная частная средняя школа в Турции (анонимизирована) — контролируемый исследователями Уортонской школы (University of Pennsylvania) эксперимент с GPT-4-репетитором на части уроков математики: рост успеваемости при использовании, но падение результатов без ИИ без защитных ограничений",
   "evidence_level": "D",
   "level_basis_ru": "Сами авторы прямо указывают, что вмешательство разработано и администрировалось исследователями Wharton School/School of Engineering (Bastani et al.), а не внедрено школой как собственная организационная программа: интервенция заняла около 15% курса математики за один семестр в рамках четырёх 90-минутных занятий, контролируемых исследователями; учителя лишь предоставляли специфичные для задач вводные данные. Соответствует прецеденту «эксперимент с придуманными исследователями заданиями ≠ изменение работы» (аналог отклонённого кейса Нацбанка Словакии) — работа школы/учителей как организации не изменилась.",
   "outcome": "mixed",
   "outcome_basis_ru": "Цель — оценить влияние доступа к GPT-4 (без ограничений — GPT Base; с методическими ограничениями — GPT Tutor) на успеваемость по математике; база — контрольная группа без доступа к ИИ; период — осенний семестр 2023/2024, около 1000 учеников 9–11 классов. Результат: во время практики с ИИ — рост на 48% (GPT Base) и 127% (GPT Tutor) относительно контроля; на последующих экзаменах без доступа к ИИ — GPT Base хуже контроля на 17%, у GPT Tutor значимой разницы с контролем не было. Разнонаправленные результаты (позитив при использовании, негатив/ноль после) → mixed.",
   "primary_category": "out_of_scope",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Рост успеваемости во время практики с ИИ, GPT Base",
     "value": "+48",
     "unit": "%",
     "period": "осень 2023/2024, 4 занятия",
     "baseline": "контроль без ИИ",
     "source_url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/"
    },
    {
     "name_ru": "Рост успеваемости во время практики с ИИ, GPT Tutor (с защитными ограничениями)",
     "value": "+127",
     "unit": "%",
     "period": "осень 2023/2024",
     "baseline": "контроль без ИИ",
     "source_url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/"
    },
    {
     "name_ru": "Падение результатов на последующем экзамене без ИИ, GPT Base",
     "value": "-17",
     "unit": "%",
     "period": "экзамен после практики",
     "baseline": "контроль без ИИ",
     "source_url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/"
    }
   ],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "Учащиеся с доступом к нерегулируемому GPT-4 («GPT Base») во время практики показали рост результатов на 48%, но на итоговом экзамене без ИИ — результаты на 17% хуже контрольной группы.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/",
       "title": "Generative AI without guardrails can harm learning: Evidence from high school mathematics",
       "publisher": "PNAS / PMC",
       "published": "2025",
       "origin": "academic",
       "quote_original": "GPT Base improved performance by 48%... on unassisted exams, GPT Base students performed a 17% reduction in grades compared to control",
       "quote_ru": "GPT Base улучшил результаты на 48%… на экзаменах без ИИ у студентов GPT Base оценки были на 17% ниже, чем в контрольной группе"
      }
     ]
    },
    {
     "claim_ru": "Вмешательство было спроектировано и администрировалось исследователями Уортонской школы, а не внедрено школой как самостоятельная программа; это была экспериментальная манипуляция, охватившая около 15% курса математики за семестр.",
     "status": "VERIFIED",
     "what_verified": "implementation_fact",
     "evidence": [
      {
       "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/",
       "title": "Generative AI without guardrails can harm learning",
       "publisher": "PNAS / PMC",
       "published": "2025",
       "origin": "academic",
       "quote_original": "This was a purely experimental manipulation, not an adopted organizational program",
       "quote_ru": "Это было чисто экспериментальное вмешательство, а не принятая организацией программа"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Версия с методическими ограничениями (GPT Tutor, дающая подсказки вместо готовых ответов) не показала значимого негативного эффекта на последующем экзамене — дизайн вмешательства (ограничения) способен нейтрализовать вред.",
   "alternative_explanations_ru": "Эффект может быть специфичен для предмета (математика), формата (короткие 90-минутные занятия) и отсутствия долгосрочной интеграции — школа не адаптировала методику преподавания под постоянное использование ИИ, поэтому результат не отражает изменённую организационную практику.",
   "human_role_ru": "Учителя предоставляли специфичные для задач вводные данные для промптов, но не контролировали дизайн эксперимента и не меняли постоянную методику преподавания; замена/дополнение роли учителя происходили только в рамках 4 занятий эксперимента.",
   "timeline_ru": "Осенний семестр 2023/2024 уч. года; публикация в PNAS в 2025 (DOI 10.1073/pnas.2422633122).",
   "limitations_ru": "По формальному критерию задания это исследовательски-контролируемый эксперимент на реальных учениках, а не изменение работы организации: школа сама не приняла и не масштабировала практику по итогам исследования (сведений о последующем внедрении не найдено); авторы ограничивают выводы одной школой, одним предметом и краткосрочным горизонтом.",
   "counted_in_120_proposed": false,
   "reason_ru": "Не соответствует критерию «изменение работы организации»: по прямому признанию авторов, это контролируемая исследователями экспериментальная манипуляция (аналог отклонённого кейса Нацбанка Словакии), а не организационно внедрённая программа школы; категория out_of_scope, несмотря на строгий РКИ-дизайн и публикацию в PNAS.",
   "sources_opened": [
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC12232635/"
   ],
   "unreachable": [
    "https://www.pnas.org/doi/10.1073/pnas.2422633122 (403)",
    "https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4895486 (не открыт)"
   ],
   "company": "Анонимная крупная частная средняя школа, Турция; исследование — Wharton School и School of Engineering, University of Pennsylvania",
   "country": "Турция",
   "process": "Использование ИИ-репетитора учениками на части уроков математики в рамках исследовательского вмешательства (не собственная программа школы)",
   "period": "осень 2023/2024",
   "region": "OTHER"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-08",
   "label_ru": "Alpha School / «2 Hour Learning» (сеть частных школ, Остин и другие штаты США) — замена очного предметного преподавания на ИИ-платформу и «гидов»: заявления об успеваемости не подтверждены независимой проверкой",
   "evidence_level": "D",
   "level_basis_ru": "Все данные об успеваемости (тесты NWEA MAP) — внутренний анализ самой школы/сети; согласно энциклопедической статье со ссылками на СМИ, рецензируемых исследований, подтверждающих эффективность модели, нет, независимая проверка данных отсутствует. Первичный документ с прозрачным измерением недоступен — заявления сделаны основателями (в т.ч. MacKenzie Price) в интервью СМИ.",
   "outcome": "unknown",
   "outcome_basis_ru": "Компания заявляет о попадании учеников в топ-1–2% по тестам NWEA MAP и обучении в 2–2.6 раза быстрее нормы, но независимая проверка данных отсутствует, база сравнения и точный период по годам не раскрыты в первичном виде — исход относительно объективной, независимо измеренной метрики не установлен.",
   "primary_category": "agentic_interaction",
   "extra_labels": [
    "adjacent_automation"
   ],
   "metrics": [],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "Публично доступные источники подтверждают отсутствие независимой проверки и рецензируемых исследований модели «2 Hour Learning», несмотря на заявления школы об опережающих результатах по тестам NWEA MAP.",
     "status": "VERIFIED",
     "what_verified": "none",
     "evidence": [
      {
       "url": "https://en.wikipedia.org/wiki/Alpha_School",
       "title": "Alpha School",
       "publisher": "Wikipedia (со ссылками на СМИ)",
       "published": "2026",
       "origin": "media_repeat",
       "quote_original": "the underlying data has not been independently reviewed... There is a lack of peer reviewed studies validating the effectiveness of the 2-Hour Learning approach, and no independent research has examined whether reported student outcomes are attributable to the program itself or to other factors.",
       "quote_ru": "лежащие в основе данные не прошли независимую проверку… отсутствуют рецензируемые исследования, подтверждающие эффективность подхода «2-Hour Learning», и ни одно независимое исследование не изучало, обусловлены ли заявленные результаты учеников самой программой или другими факторами"
      }
     ]
    },
    {
     "claim_ru": "Департамент образования штата Пенсильвания отклонил заявку на чартерную школу по этой модели, назвав подход «непроверенным» (untested).",
     "status": "VERIFIED",
     "what_verified": "none",
     "evidence": [
      {
       "url": "https://en.wikipedia.org/wiki/Alpha_School",
       "title": "Alpha School",
       "publisher": "Wikipedia",
       "published": "2026",
       "origin": "regulator",
       "quote_original": "Pennsylvania Department of Education rejected a charter application, describing the instructional model as \"untested\"",
       "quote_ru": "Департамент образования Пенсильвании отклонил заявку на чартерную школу, назвав учебную модель «непроверенной»"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Отказ регулятора штата Пенсильвания в чартере — независимое (хотя и процедурное, не измерительное) свидетельство сомнений в доказательной базе модели.",
   "alternative_explanations_ru": "Селекция учеников (платная частная школа с отбором по мотивации/доходу семьи) может объяснять высокие баллы независимо от эффекта технологии; сравнение с национальными нормами MAP не учитывает состав контингента.",
   "human_role_ru": "Очные предметные учителя заменены на «гидов» (guides), которые не преподают содержание, а сопровождают самостоятельную работу учеников с адаптивным ПО; преподавание содержания делегировано ИИ/адаптивному софту.",
   "timeline_ru": "Модель развивается с 2010-х годов; активная экспансия и медиавнимание — 2023–2026; проверка выполнена 23.09.2026 по странице Wikipedia со ссылками на СМИ (Fox News, Newsweek).",
   "limitations_ru": "Не найдено ни одного первичного документа с прозрачным независимым измерением; вся информация — вторичная (энциклопедия, СМИ); это задокументированный пример отсутствия доказательной базы, а не подтверждённый успех или провал.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень D: первоисточник (внутренние данные NWEA MAP) недоступен и независимо не подтверждён; исход не установлен независимо, несмотря на публичные заявления об успехе.",
   "sources_opened": [
    "https://en.wikipedia.org/wiki/Alpha_School"
   ],
   "unreachable": [
    "https://www.foxnews.com/media/texas-private-schools-use-ai-tutor-rockets-student-test-scores-top-2-country (не открыт напрямую)"
   ],
   "company": "Alpha School и связанные коммерческие структуры (2 Hour Learning, Trilogy Enterprises, Crossover Markets)",
   "country": "США",
   "process": "Замена очного предметного преподавания на самостоятельную работу учеников с адаптивным ИИ-ПО под наблюдением неметодических «гидов»",
   "period": "2023–2026 (текущая экспансия)",
   "region": "US"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-09",
   "label_ru": "Georgia Institute of Technology (лаборатория Ashok Goel, курс OMSCS Knowledge-Based AI) — виртуальный ассистент преподавателя Jill Watson на базе ChatGPT: самостоятельная разработка и самооценка создателями",
   "evidence_level": "C",
   "level_basis_ru": "Все 6 авторов статьи — сотрудники Georgia Tech из той же лаборатории, что разработала Jill Watson (Karan Taneja, Pratyusha Maiti, Sandeep Kakar, Pranav Guruprasad, Sanjeev Rao, Ashok K. Goel); разработчики сами оценивают собственный инструмент на собственном курсе — полное совпадение происхождения данных и анализа, как в отклонённом прецеденте Princeton.",
   "outcome": "success",
   "outcome_basis_ru": "Цель — точность и безопасность ответов виртуального ассистента в реальном онлайн-курсе; метрика — доля правильных ответов на 150 тестовых вопросах, доля вредных/запутывающих ответов; база — сравнение с более ранней версией Jill Watson и с OpenAI Assistants API; период — осень 2023, курс Knowledge-Based AI (OMSCS). Результат (самооценка разработчиков): новая Jill Watson отвечает правильно в 76.7% случаев (против 26% у прежней версии и 31.3% у OpenAI Assistants), доля вредных ответов 5.7% против 16.5% у OpenAI Assistants.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Доля правильных ответов, новая Jill Watson",
     "value": "76.7",
     "unit": "%",
     "period": "осень 2023, курс OMSCS Knowledge-Based AI",
     "baseline": "OpenAI Assistants — 31.3%; прежняя Jill Watson — 26%",
     "source_url": "https://arxiv.org/html/2405.11070v1"
    },
    {
     "name_ru": "Доля вредных ответов",
     "value": "5.7",
     "unit": "%",
     "period": "осень 2023",
     "baseline": "OpenAI Assistants — 16.5%",
     "source_url": "https://arxiv.org/html/2405.11070v1"
    }
   ],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "На 150 тестовых вопросах новая версия Jill Watson давала верный ответ в 76.7% случаев против 31.3% у OpenAI Assistants и 26% у прежней версии Jill Watson.",
     "status": "VERIFIED",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://arxiv.org/html/2405.11070v1",
       "title": "Jill Watson: A Virtual Teaching Assistant powered by ChatGPT",
       "publisher": "arXiv (Georgia Tech)",
       "published": "2024-05",
       "origin": "company",
       "quote_original": "76.7%... compared to 26% for legacy Jill Watson and 31.3% for OpenAI Assistants",
       "quote_ru": "76,7%… по сравнению с 26% у прежней Jill Watson и 31,3% у OpenAI Assistants"
      }
     ]
    }
   ],
   "counter_evidence_ru": "Не найдено ни одной независимой (внешней по отношению к лаборатории-разработчику) оценки эффективности Jill Watson; сравнение проводилось по метрикам, выбранным самими разработчиками (синтетические тестовые вопросы, а не реальные оценки студентов курса или влияние на успеваемость).",
   "alternative_explanations_ru": "Улучшение показателей может отражать прогресс версии системы (модульная архитектура vs. простой ассистент), а не превосходство концепции «виртуального ассистента преподавателя» как такового; сравнение с OpenAI Assistants API — это сравнение с типовым инструментом, а не с педагогической альтернативой (например, обычным TA).",
   "human_role_ru": "Jill Watson дополняет (не заменяет) преподавателя и человека-TA на форуме вопросов и ответов крупного онлайн-курса (600+ студентов); ограничена короткими вопросами, не может синтезировать ответы по нескольким документам.",
   "timeline_ru": "Развёртывание — осень 2023, курс OMSCS Knowledge-Based AI; далее курс Introduction to Cognitive Science и колледж Wiregrass Georgia Technical College; препринт arXiv — май 2024.",
   "limitations_ru": "Полное отсутствие независимости между разработчиком и оценщиком; метрики измерены на искусственно составленных тестовых вопросах, а не на реальном взаимодействии со студентами в течение семестра; влияние на итоговую успеваемость или нагрузку преподавателя/TA неизвестно.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C: разработчики инструмента полностью совпадают с исследователями/оценщиками (тот же паттерн, что и отклонённый кейс Princeton), независимого подтверждения нет.",
   "sources_opened": [
    "https://arxiv.org/html/2405.11070v1"
   ],
   "unreachable": [],
   "company": "Georgia Institute of Technology (Design & Intelligence Lab, Ashok K. Goel)",
   "country": "США",
   "process": "Ответы на вопросы студентов на форуме крупного онлайн-курса — функция, ранее выполнявшаяся человеком-ассистентом преподавателя (TA)",
   "period": "осень 2023",
   "region": "US"
  },
  {
   "entity_id": "W8-FIELD-WORK-6-10",
   "label_ru": "Digital Promise (независимая исследовательская некоммерческая организация) — камерный качественный пилот «Estudia Khanmigo» в двух школьных сообществах Пуэрто-Рико: первичный отчёт не поддался извлечению текста, исход по вторичным описаниям неопределён",
   "evidence_level": "D",
   "level_basis_ru": "Первичный отчёт (PDF Digital Promise, сентябрь 2024) не открылся для извлечения текста (бинарный/сжатый файл; инструмент WebFetch не смог распарсить содержимое дважды). Digital Promise — организация, независимая от Khan Academy (разработчика Khanmigo), что задаёт потенциал уровня B при личном прочтении, но без успешного открытия документа утверждения остаются вторичными (SOURCE_CLAIM); уровень D — первоисточник фактически недоступен.",
   "outcome": "unknown",
   "outcome_basis_ru": "По вторичным (не лично открытым) описаниям — исследовательская команда Digital Promise была «встроена» в два школьных сообщества Пуэрто-Рико для внедрения Khanmigo и устранения барьеров использования; заявлены как ранние успехи, так и проблемы, но количественная метрика и её база/период не установлены из-за недоступности документа. Исход не определён по протоколу (первоисточник недоступен).",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [],
   "arithmetic": [],
   "claims": [
    {
     "claim_ru": "Digital Promise при поддержке Gates Foundation провела небольшой пилотный проект внедрения Khanmigo в двух школьных общинах Пуэрто-Рико, оценивая восприятие инструмента учениками и учителями.",
     "status": "SOURCE_CLAIM",
     "what_verified": "none",
     "evidence": [
      {
       "url": "https://digitalpromise.org/wp-content/uploads/2024/09/SRM-Gates-Khanmigo-Report-Final.pdf",
       "title": "Estudia Khanmigo: An equity-focused pilot exploration",
       "publisher": "Digital Promise",
       "published": "2024-09",
       "origin": "independent",
       "quote_original": "",
       "quote_ru": ""
      }
     ]
    }
   ],
   "counter_evidence_ru": "Нет данных — первоисточник недоступен для оценки counter evidence.",
   "alternative_explanations_ru": "Нет данных — первоисточник недоступен.",
   "human_role_ru": "По вторичным описаниям, речь идёт о взаимодействии учеников и учителей с Khanmigo при сопровождении исследовательской команды Digital Promise, устранявшей технические и методические барьеры внедрения.",
   "timeline_ru": "Отчёт датирован сентябрём 2024; попытки открытия — 23.09.2026.",
   "limitations_ru": "Ключевое ограничение: первичный документ дважды не открылся для WebFetch (бинарное содержимое, не поддающееся парсингу); все утверждения по этому кейсу — SOURCE_CLAIM по вторичным веб-описаниям, а не дословные цитаты из лично прочитанного документа; сам PDF помечен как unreachable.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень D — первоисточник недоступен, исход неизвестен; включён как честно задокументированный пример недостижимости данных, а не как предлагаемый в 120 случай.",
   "sources_opened": [],
   "unreachable": [
    "https://digitalpromise.org/wp-content/uploads/2024/09/SRM-Gates-Khanmigo-Report-Final.pdf (бинарный PDF, не распарсен дважды)"
   ],
   "company": "Digital Promise (независимый оценщик); школы — два сообщества в Пуэрто-Рико (не названы); продукт — Khanmigo (Khan Academy); финансирование — Bill & Melinda Gates Foundation",
   "country": "США (Пуэрто-Рико)",
   "process": "Внедрение ИИ-репетитора Khanmigo в двух школьных общинах при сопровождении независимой исследовательской команды",
   "period": "2024",
   "region": "US"
  }
 ],
 "packet_notes_ru": "Найдено и проверено 10 новых случаев по направлению W8-FIELD-WORK (образовательные организации-работодатели/сервисы), 2023-2026. Фактически использовано 26 вызовов WebSearch из бюджета 30 (WebFetch использовался без ограничения по числу, но многие PDF (nssa.stanford.edu, edworkingpapers.com PDF, SSRN, PNAS.org, Digital Promise, tandfonline, researchgate, academia.edu, EEF educationendowmentfoundation.org.uk) вернули либо 403, либо бинарное содержимое, не поддающееся извлечению текста — такие страницы отмечены как unreachable, а связанные утверждения понижены до SOURCE_CLAIM или уровня C/D. Уровни: A=1 (EEF/NFER ChatGPT lesson planning), B=4 (Tutor CoPilot; GSU «Let's Chat»/Pounce; PLOS One AI-grading; Squirrel AI/Yixue+SRI), C=3 (Rori Ghana — ведущий автор является продакт-менеджером компании-оператора; Jill Watson Georgia Tech — разработчики сами оценивают свой инструмент, паттерн Princeton), D=2 (Alpha School — нет независимой проверки; Khanmigo Puerto Rico/Digital Promise — первоисточник не поддался извлечению текста), out_of_scope=1 (Bastani et al., Турция — по признанию самих авторов это контролируемый исследователями эксперимент, а не организационно внедрённая программа школы, аналог отклонённого кейса Нацбанка Словакии). Исходы: success=5 (EEF, GSU Pounce, Squirrel AI, Rori [самоотчёт], Jill Watson [самооценка]), mixed=3 (Tutor CoPilot, PLOS grading, Bastani Turkey), unknown=2 (Alpha School, Khanmigo Puerto Rico). В 120 предложено 5: Tutor CoPilot (W8-FIELD-WORK-6-01), EEF ChatGPT lesson planning (6-02), GSU Pounce/Let's Chat (6-03), PLOS One AI-grading (6-04), Squirrel AI/Yixue+SRI (6-05). Проверены по known-entities.txt (~577 строк) — пересечений с Oak/Aila, Edo State, Princeton, CSU×OpenAI, LAUSD Ed, Vanderbilt, Lawrence USD, Adelphi, Miami-Dade, Estonian AI Leap, iTutorGroup не найдено; также сверено с предыдущими пакетами W8-FIELD-WORK..W8-FIELD-WORK-5 (Princeton и Northwestern Medicine уже учтены там, не дублируются). Не включены в пакет (найдены, но отклонены как явно не подходящие/слишком слабые до статуса полноценной сущности): CCCCO «Cali» финансовая помощь-чат-бот (самоотчёт CCCCO, нет РКИ/квазиэксперимента); отчёт Digital Promise «28 exploratory projects» (слишком диффузный, не привязан к одной организации); RAND «American School District Panel» (национальный опрос, не конкретная организация); EEF/Aila trial (результаты ожидаются осенью 2026, ещё не опубликованы); IDB и Avanti Fellows (India) — релевантных завершённых РКИ с измеренным исходом в пределах бюджета поиска не найдено. Запрет на передачу данных пользователя соблюдён: во всех веб-запросах использовались стандартные инструменты (WebSearch/WebFetch) без передачи персональных данных."
}