{
 "packet_id": "W8-FIELD-WORK-8",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T16:00:00Z",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-8-01",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "A",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "Полный текст IZA DP 18224 (41 с.) открыт и прочитан лично. Авторы внешние: Маастрихтский университет, IAB, IZA; компания анонимна, её сотрудников среди соавторов нет; компания дала доступ к данным и интервью. Финансирование — проект ai:conomics министерства труда Германии (BMAS). Анализ независим, но данные — административные KPI и выход ИИ-инструмента самой компании; для исхода по AHT это приемлемо (объективный учёт звонков), для стиля коммуникации метрики генерирует сам оцениваемый инструмент.",
    "Дизайн: ступенчатое внедрение по командам с контрольной группой — не рандомизация (очерёдность определила компания, распределение команд — в феврале 2023, «без конкретной цели»). Событийный анализ Callaway–Sant'Anna; есть проверки на never-treated и not-yet-treated, отдельно — на географически удалённых. Измерение прозрачно, контроль есть, реальная работа (не задания исследователей) — по прецеденту уровень A заслужен. Рецензии нет: IZA DP — рабочая статья; IZA прямо предупреждает, что это «preliminary work». Журнальной версии поиск не выявил.",
    "Ошибка автора: ИИ-аналитику получили не «две из пяти команд», а четыре из пяти (команды 1–2 — 1 мая 2023, команды 3–4 — 17 июля 2023); команда 5 — контрольная, получила ИИ-обучение 1 ноября 2023. В timeline_ru «июль 2023 — уточнение/продолжение» нужно заменить на «июль 2023 — вторая волна, команды 3–4».",
    "Окно наблюдения внутренне противоречиво: текст — февраль–декабрь 2023, подпись к рис. 1 — недели 5–44/2023 (≈ февраль–октябрь). Окно событий — от −3 до +3/4 месяцев. Эффект после внедрения — 5–7 месяцев (июль/май → ноябрь), долгосрочный эффект не измерен. Это стоит указать в period.",
    "Арифметика: авторы дают базу до воздействия — 636 с (табл. 3), а не выведенные автором пакета ≈667 с; 60/636 = 9,4%. Оценки AHT по спецификациям: −68 с (−11%), −92 с (−14%, TWFE CS), −60 с (−9%, предпочтительная, с поправкой на стаж); абстракт и заключение округляют до 10%. Использовать 9% (предпочтительная спецификация).",
    "Контрольная группа несбалансирована: 63 агента в команде 5 против 84 в командах 1–4; ≈40% выборки — опытные агенты вне стандартного обучения, все в контроле. Авторы делают перевзвешивание по стажу, но стаж доступен только тремя грубыми категориями. Удовлетворённость клиентов: +0,44 п. (≈5%), значимость лишь на уровне 10%, оценки есть только у ≈7% звонков. На среднее число звонков в день эффекта нет.",
    "Терминология: в тексте автора пакета повторяется неверный перевод «доабандоновский» — правильно «до воздействия» (pre-treatment). Стоит уточнить, что ИИ здесь не генеративный: это NLP-классификатор с заранее заданными метками; агенты его данные напрямую не видят."
   ],
   "added_evidence": [
    {
     "url": "https://docs.iza.org/dp18224.pdf",
     "publisher": "IZA Institute of Labor Economics",
     "published": "2025-10",
     "origin": "academic",
     "quote_original": "AI-augmented training was introduced for Teams 1 and 2 on May 1, 2023, followed by Teams 3 and 4 on July 17, 2023. Team 5 received AI-augmented training on November 1, 2023.",
     "quote_ru": "ИИ-дополненное обучение ввели для команд 1 и 2 1 мая 2023 года, затем для команд 3 и 4 17 июля 2023 года. Команда 5 получила ИИ-дополненное обучение 1 ноября 2023 года."
    },
    {
     "url": "https://docs.iza.org/dp18224.pdf",
     "publisher": "IZA Institute of Labor Economics",
     "published": "2025-10",
     "origin": "academic",
     "quote_original": "Column 3 of Table 3 controls for pre-treatment tenure and yields an estimated effect of about -60 seconds, or -9 percent.",
     "quote_ru": "Столбец 3 таблицы 3 учитывает стаж до воздействия и даёт оценку эффекта около −60 секунд, или −9 процентов."
    },
    {
     "url": "https://docs.iza.org/dp18224.pdf",
     "publisher": "IZA Institute of Labor Economics",
     "published": "2025-10",
     "origin": "academic",
     "quote_original": "IZA Discussion Papers often represent preliminary work and are circulated to encourage discussion.",
     "quote_ru": "Дискуссионные статьи IZA часто представляют собой предварительную работу и распространяются для обсуждения."
    }
   ],
   "sources_opened": [
    "https://docs.iza.org/dp18224.pdf",
    "https://www.iza.org/publications/dp/18224/how-ai-augmented-training-improves-worker-productivity (в выдаче поиска)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-8-02",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Полный текст arXiv:2602.13766v1 открыт лично. Жанр — промышленный кейс-стади по Runeson/Yin, а не полевой эксперимент: сравнение до/после тех же команд, параллельной контрольной группы нет. Авторы сами признают, что эффект нельзя отделить от взросления команды и сопутствующих событий (maturation/history). По прецеденту (кейс-стади без контроля) это уровень C, не A. Метрики из Jira, SonarQube и Git — плюс, но контроль отсутствует.",
    "Происхождение данных и дизайна не вполне независимо: протокол и метрики разработали совместно с инновационным подразделением фирмы; кейсы отбирала руководящая группа фирмы; интервью проводили вместе со специалистами Microsoft; исследование «позиционировалось внутри» как ориентир для стратегии фирмы по ИИ. Авторы — сотрудники университетов (первый автор — аспирант PUC-Rio), аффилированных с фирмой соавторов не найдено. Отбор кейсов прагматичный: 3 из 10; исключены проекты с недоступной телеметрией и низкой вовлечённостью, т. е. возможен отбор ранних сторонников.",
    "Главная метрика слабая: story points — оценка самой команды. Рост на 59,1% (281→447) дан только для Case J, по D и F не приведён, но в «Key Takeaway» обобщён на все команды. Табл. 3: запланированные story points выросли с 447 до 1155 (+158%), доля выполненного упала с 62,9% до 38,7%, остаток невыполненного — со 166 до 708 (+327%). Возможна инфляция оценок; неверно считать это однозначным ростом производительности.",
    "Ошибка автора пакета: p-значения 4.94e-07 и 6.15e-10 относятся к запланированным и оставшимся story points, а не к завершённым; в claim_ru формулировка «рост на 59,1%… p<0.001» приписывает значимость не той метрике. Кроме того, тест Манна–Уитни в статье назван тестом «для парных выборок» (это не так), а пропуски в Jira заполнены средними и сверены с самоотчётами.",
    "Табл. 1 содержит несостыковку: у Case J squad 2 историческая фаза заканчивается 09.06.2024, а кикофф указан 01.04.2024. Число проблем SonarQube дано абсолютным, без нормировки на объём кода. В Case F число проблем низкой критичности выросло (29→42), в D — 28→103 (+268%).",
    "Исход mixed по собственным данным оставляю (качество ухудшилось в D, активность без изменений, доля выполненного снизилась). Вклад ИИ не установлен, поэтому в 120 не засчитывается. Рецензия: принято на FORGE 2026 (комментарий arXiv), журнальной версии нет. Страна команд не названа; по финансированию вероятна Бразилия."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2602.13766",
     "publisher": "arXiv",
     "published": "2026-02-14",
     "origin": "academic",
     "quote_original": "A primary threat is that the 59.1% productivity increase could be attributed to the teams’ natural maturation and increased project familiarity over the 13-month study period.",
     "quote_ru": "Главная угроза в том, что рост производительности на 59,1% может объясняться естественным взрослением команд и лучшим знанием проекта за 13 месяцев исследования."
    },
    {
     "url": "https://arxiv.org/pdf/2602.13766",
     "publisher": "arXiv",
     "published": "2026-02-14",
     "origin": "academic",
     "quote_original": "Interestingly, the team’s planned story points (from 447 to 1155) increased by ≈150% in the same period, suggesting that GenAI adoption may have also increased the team’s confidence in its capacity, leading them to commit to more work.",
     "quote_ru": "Интересно, что за тот же период запланированные командой story points выросли примерно на 150% (с 447 до 1155); это говорит о том, что внедрение GenAI, возможно, повысило уверенность команды в своих силах и она стала брать больше работы."
    },
    {
     "url": "https://arxiv.org/pdf/2602.13766",
     "publisher": "arXiv",
     "published": "2026-02-14",
     "origin": "academic",
     "quote_original": "Before the formal data collection phase, the consulting firm’s innovation unit and the research team conducted a series of Design Thinking sessions to co-design the study protocol and ensure its alignment with both organizational priorities and the research objectives.",
     "quote_ru": "До формального сбора данных инновационное подразделение консалтинговой фирмы и исследовательская группа провели серию сессий дизайн-мышления, чтобы совместно разработать протокол исследования и согласовать его с приоритетами организации и целями исследования."
    },
    {
     "url": "https://arxiv.org/abs/2602.13766",
     "publisher": "arXiv",
     "published": "2026-02-14",
     "origin": "academic",
     "quote_original": "Preprint with the original submission accepted for publication at Forge 2026",
     "quote_ru": "Препринт; исходная версия принята к публикации на FORGE 2026."
    }
   ],
   "sources_opened": [
    "https://arxiv.org/pdf/2602.13766",
    "https://arxiv.org/abs/2602.13766"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-8-03",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Реферат через Crossref (DOI 10.3390/informatics13030044, опубл. 19.03.2026) открыт лично; обе цитаты автора дословны. Страница MDPI по-прежнему отдаёт 403. Уровень C и незасчёт подтверждаю.",
    "Исход: «рост эффективности» — это восприятие госслужащих по шкалам Лайкерта, а не измеренные показатели. По урокам 23.09 восприятие ≠ измеренный исход, поэтому рекомендую outcome=unknown вместо success (единственное изменение). Роль ИИ в работе не описана; организации не названы."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://api.crossref.org/works/10.3390/informatics13030044",
    "https://www.mdpi.com/2227-9709/13/3/44 (HTTP 403)"
   ]
  }
 ],
 "unchecked_entity_ids": [],
 "packet_notes_ru": "Фактическое число WebSearch при проверке — 2 (лимит 10). Проверены все три сущности; полные тексты IZA DP 18224 и arXiv 2602.13766 открыты лично через curl с User-Agent \"Mozilla/5.0\", данных пользователя в запросах нет. Системные ошибки автора: (1) уровень A присвоен неконтролируемому до/после кейс-стади (02), хотя по прецеденту A требует контроля; (2) p-значения приписаны не той метрике (02); (3) неверно пересказан ход внедрения (01: не 2, а 4 из 5 команд) и выведена база ≈667 с вместо указанных 636 с; (4) повторяется неверный перевод «доабандоновский» (pre-treatment); (5) самоотчётное восприятие помечено как success (03). Итог: в 120 засчитывается только 01 (A, success). Превышение исследовательского бюджета WebSearch (31/30) автор отметил сам. Черновики проверяющего (v_iza.*, v_arx*.*, v_build.py) лежат в папке пакета."
}