{
 "packet_id": "W8-FIELD-WORK-2",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T15:10:00+03:00",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-2-01",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "ГЛАВНАЯ ОШИБКА: утверждение автора «авторы — экономисты BIS, не сотрудники Ant Group» ложно. В сноске PDF: «Shuo Shan (email: shanshuo.ss@antgroup.com) is with Ant Group… Shuo Shan discloses an employment relationship in Ant Group». Данные — внутренние данные Ant, анализ выполнялся удалённо «on the Ant Open Research Laboratory in an Ant Group Environment». Происхождение данных — одно (компания). Трое из четырёх авторов — из BIS, поэтому это не чистый самоотчёт. Уровень A не заслужен: независимого подтверждения исхода нет. Понижено до B — так же, как в прецеденте W8-FIELD-WORK-01 (Microsoft/GitHub, 2 из 6 соавторов из компании). Строго по v0.4 разд. 7 для B нужен второй независимый источник, а его нет. Зачёт в 120 держится только на этом прецеденте; решение за координатором.",
    "PDF по старому адресу bis.org/publ/work1208.pdf отдаёт HTML-страницу, а не PDF. Фраза автора «лично открыт PDF» сомнительна: аффилиация Shan видна только в PDF. Рабочий PDF: https://www.bis.org/publications/working-paper-1208-generative-ai-and-labour-productivity-field-experiment-coding.pdf (9 страниц).",
    "Это не РКИ. Лечение назначено по подразделениям: 335 программистов «belonging to two specific departments» против 884 из других отделов. Дальше — PSM и diff-in-diff. Позднейшая журнальная версия прямо называется «A quasi experiment on coding» (ScienceDirect S1572308926000458, 2026; открыть не удалось, 403).",
    "Изменение работы реальное. Шестинедельный пилот CodeFuse шёл на реальной работе программистов (04.09–25.11.2023, 12 недель наблюдения). Затем инструмент стал доступен всем: «right before CodeFuse became generally available to all programmers». Это изменение процесса организации, а не лабораторный тест.",
    "Пересчёт. Метрика — логарифм числа строк кода, поэтому 55% — это лог-пункты. Как множитель это exp(0,55)−1 ≈ 73%. Описательный diff-in-diff в таблице 1: (6,79−6,46)−(6,24−6,44) = 0,53 лог-пункта; в тексте написано «around 53%». В тексте на с. 3 перепутаны группы (рост 0,33 приписан контролю, падение 0,20 — лечению), в таблице наоборот. Опечатка в первоисточнике.",
    "Уточнение про прямой вклад LLM. В тексте: прямой вклад — 11–18 п.п. из 55, «the remaining 36-43% increase in productivity is probably due to the time saving». «Около трети» относится к аннотации на странице BIS. Для junior-сотрудников прирост +67%; эффект для senior положительный, но незначим.",
    "Число строк кода — узкая мера выработки, а не качества или ценности. Исход success относится только к этой метрике.",
    "Цитаты дословны. «more than 50%» — аннотация PDF и страницы; «increased by 55%» — раздел Findings страницы work1208.htm. Дата 04.09.2024 в окне."
   ],
   "added_evidence": [
    {
     "url": "https://www.bis.org/publications/working-paper-1208-generative-ai-and-labour-productivity-field-experiment-coding.pdf",
     "publisher": "Bank for International Settlements",
     "published": "2024-09",
     "origin": "academic (соавтор из Ant Group, данные компании)",
     "quote_original": "Shuo Shan (email: shanshuo.ss@antgroup.com) is with Ant Group.",
     "quote_ru": "Шо Шань (email: shanshuo.ss@antgroup.com) работает в Ant Group."
    },
    {
     "url": "https://www.bis.org/publications/working-paper-1208-generative-ai-and-labour-productivity-field-experiment-coding.pdf",
     "publisher": "Bank for International Settlements",
     "published": "2024-09",
     "origin": "academic",
     "quote_original": "A treatment group of 335 programmers, belonging to two specific departments, was informed and received precise instructions about the new LLM",
     "quote_ru": "Группа лечения из 335 программистов из двух конкретных подразделений была проинформирована о новой LLM и получила подробные инструкции"
    }
   ],
   "sources_opened": [
    "https://www.bis.org/publ/work1208.htm",
    "https://www.bis.org/publications/working-paper-1208-generative-ai-and-labour-productivity-field-experiment-coding.pdf",
    "https://econpapers.repec.org/paper/bisbiswps/1208.htm",
    "https://www.sciencedirect.com/science/article/abs/pii/S1572308926000458 (403)"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-02",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": true,
   "issues_ru": [
    "Ошибка в числе соавторов из компании. У «e Alibaba Group Inc.» двое — Yitong Wang и Congyi Zhou, то есть 2 из 6, а не 1. Эксперимент провела сама Alibaba («Alibaba conducted a four-week randomized A/B test»); данные — платформенные. Происхождение данных — компания, анализ — большинство внешних академиков. Независимого второго источника нет. B — по прецеденту W8-FIELD-WORK-01/02; строго по v0.4 разд. 7 для B нужен второй независимый источник.",
    "Изменение работы реальное: РКИ на реальных чатах (2 564 606 сообщений агентов), 5 940 новых агентов (стаж меньше года), 23.01–19.02.2024. С 20.02.2024 ассистент развёрнут на всех агентов («the assistant was launched to all agents on February 20, 2024»).",
    "Пересчёт верен: 0,042/3,46 = 1,2%; 0,012/0,35 = 3,4%. Коэффициент −0,082 — лог-пункты, то есть exp(−0,082)−1 ≈ −7,9%, а не ровно −8,2%. Время: 41,18 → 38,61 с (описательно). Эффект на повторное обращение в течение 3 дней ≈ 0, незначим.",
    "Исход mixed подтверждён: в верхнем квинтиле агентов снижаются и рейтинг, и объективное качество (повторные обращения).",
    "Статус публикации: препринт. SSRN 5012601 от 06.11.2024, arXiv 2603.29888, версия от июля 2026. Не рецензирован; журнальной версии поиск не нашёл. В поле published лучше указать 2024-11 (SSRN), а не 2026-07.",
    "Цитаты дословны (аннотация).",
    "Отношение к 03 — два разных случая: разные инструменты (ассистент против автономного агента), разные рандомизации, периоды (янв–фев 2024 против авг 2024), выборки и статьи. Но у них общая исследовательская группа (Y. Wang, T. Feng, L. Lu), одна организация, один процесс и данные Alibaba. Засчитывать отдельно с флагом shared_origin; взаимным подтверждением они не являются."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2603.29888",
     "publisher": "arXiv (SSRN 5012601)",
     "published": "2024-11 (SSRN); ред. 2026-07",
     "origin": "academic + Alibaba (2 из 6 соавторов)",
     "quote_original": "The experiment ended on February 19, 2024, and the assistant was launched to all agents on February 20, 2024.",
     "quote_ru": "Эксперимент завершился 19 февраля 2024 г., а 20 февраля 2024 г. ассистент был развёрнут для всех агентов."
    }
   ],
   "sources_opened": [
    "https://arxiv.org/pdf/2603.29888"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-03",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": true,
   "issues_ru": [
    "Один соавтор из Alibaba (Bingxin Jia, адрес @taobao.com) из пяти — подтверждено. Эксперимент провела Alibaba; данные — платформенные. B — по прецеденту W8-FIELD-WORK-01/02; строго для B нужен второй независимый источник, а его нет.",
    "shared_origin с 02: та же исследовательская группа (Y. Wang, T. Feng, L. Lu), та же организация и процесс. Но это отдельная рандомизация (по ID сотрудника, 302 в лечении, 345 в контроле, 15–31.08.2024), другой инструмент и другая статья. Засчитывать отдельно, с флагом.",
    "Изменение работы реальное: после эксперимента агентный ИИ развёрнут на всех («the agentic AI system was rolled out to all workers beginning the next day»). Масштаб узкий: AI-eligible чаты — меньше 10% потока (в выборке 39 432, 5,8%). Лечение длилось 17 дней.",
    "Числа сверены: −16,8% длительности (p<0,001) и −0,412 рейтинга (p<0,001) для AI-eligible; −1,8% и +0,091 (p<0,01) для AI-ineligible. Шкала рейтинга указана явно: 1–5 (у автора «не указана»). Средний рейтинг в выборке 3,57, значит −0,412 ≈ −11,5% от среднего. Повторное обращение считается в окне 7 дней, а не 3, как в 02.",
    "Статус: препринт arXiv 2605.14830 (май 2026), не рецензирован. Цитаты дословны."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2605.14830",
     "publisher": "arXiv",
     "published": "2026-05",
     "origin": "academic + Alibaba (1 из 5 соавторов)",
     "quote_original": "The experiment ended on August 31, 2024, after which the agentic AI system was rolled out to all workers beginning the next day.",
     "quote_ru": "Эксперимент завершился 31 августа 2024 г., после чего со следующего дня агентная ИИ-система была развёрнута на всех сотрудников."
    }
   ],
   "sources_opened": [
    "https://arxiv.org/pdf/2605.14830"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-04",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Разработчик оценивает сам себя. Модель разработана внутри Northwestern Medicine Information Services; все авторы — из Northwestern. Раскрыто, что у большинства авторов есть патенты «in varying states of the application process», у Heller и Etemadi — доли в Cardiosense. Самоизмерение организации в научной форме без внешнего подтверждения — это C (как JD.com в W8-FIELD-OPS-07), а не B. Сам автор признал «одно происхождение», но поставил B — это противоречие.",
    "Дизайн нерандомизирован. Время сравнивается с «most recent consecutive studies interpreted by each radiologist… before their first model use», то есть до и после, с сопоставлением по типу снимка. Пир-ревью проводилось внутри. Сами авторы пишут: «due to this study’s nonrandomized nature, further experimental evidence is needed».",
    "Изменение работы реальное: модель встроена в живой клинический поток 12 больниц (15.11.2023–24.04.2024). Пересчёт (189,2−159,8)/189,2 = 15,5% верен. Цитата дословна. Дата 05.06.2025 в окне.",
    "В поле origin указано «company». Точнее — «организация о себе / разработчик»."
   ],
   "added_evidence": [
    {
     "url": "https://pmc.ncbi.nlm.nih.gov/articles/PMC12142447/",
     "publisher": "JAMA Network Open",
     "published": "2025-06-05",
     "origin": "организация-разработчик о себе",
     "quote_original": "Dr Etemadi reported having patents in varying states of the application process",
     "quote_ru": "Д-р Этемади сообщил о наличии патентов на разных стадиях оформления"
    }
   ],
   "sources_opened": [
    "https://pmc.ncbi.nlm.nih.gov/articles/PMC12142447/"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-05",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "C, mixed и незачёт подтверждаю. Все пять авторов — из Центробанка Ирландии. Кроме того, это не изменение работы организации: две сконструированные «representative tasks» (документы и данные) с лимитом 30 и 60 минут.",
    "Ошибка автора: время самоотчётное для ОБЕИХ задач («For both the Documents and Data tasks this was self-reported»), а не только для «Данных». Значит, −34% по «Документам» — тоже самоотчёт.",
    "Пересчёт: (50−33)/50 = 34%; (36,5−32,3)/36,5 = 11,5% ≈ 12%. Время по «Данным»: 32,5 против 33,5 мин, +3%, незначимо. Цитата дословна (аннотация). Дата 13.02.2025."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/pdf/2502.09479"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-06",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "ГЛАВНОЕ: это не изменение работы организации, а эксперимент на сконструированных заданиях. В аннотации: «employees completing workplace tasks that mirror the theoretical task-based framework». Задания придуманы исследователями («we designed a series of seven types of general workplace tasks», «we created two specific tasks»): вычитка абзаца, расчёт по «hypothetical new remote work policy», описание починки принтера. 14 заданий примерно по 4 минуты, плюс 2 специализированных по 30 минут. Сессия около 2 часов, оплата около 5% месячного оклада плюс бонус. Реальные рабочие задачи и процесс банка не менялись. Это тот же класс, что BCG (W8-FIELD-WORK-05, reject_counting).",
    "Ошибка в метрике: 0,24 SD — не «средний рост качества по всей выборке», а эффект на РУТИННЫХ задачах («increases productivity in routine tasks by 0.24 standard deviations, but this rises to 1.12 (= 0.24 + 0.88) standard deviations for non-routine tasks»). Итог по выборке — 94% участников получили более высокий балл с ИИ. Это подтверждено.",
    "Уровень B как оценка качества измерения допустим: 1 из 2 авторов из NBS, оценщики ослеплены, предрегистрация OSF, IRB. Но по той же логике, что 01–03, строго для B нужен второй источник. На зачёт это не влияет.",
    "Вторая цитата склеена через «...». Пропущено «, and we took the average of the evaluations across all three evaluators». Части дословны. Данные «двое из трёх оценщиков — внешние» в тексте не указаны: аффилиация аспиранта и постдока не названа.",
    "Дата 08.07.2025, эксперимент — лето 2024 (апрель — опрос, июнь — эксперимент). Окно соблюдено."
   ],
   "added_evidence": [
    {
     "url": "https://nbs.sk/dokument/5d30d37b-b007-4895-8b62-4be5ebe2a981/stiahnut/?force=false",
     "publisher": "Národná banka Slovenska, WP 13/2025",
     "published": "2025-07-08",
     "origin": "academic + NBS",
     "quote_original": "Overall, the experiment took around two hours. Participants were paid a base rate of around 5 percent of the average monthly salary at the NBS, with an additional performance bonus of up to 5 percent.",
     "quote_ru": "В целом эксперимент занял около двух часов. Участникам платили базовую ставку около 5% средней месячной зарплаты в NBS и бонус за результат до 5%."
    }
   ],
   "sources_opened": [
    "https://ideas.repec.org/p/svk/wpaper/1128.html",
    "https://nbs.sk/dokument/5d30d37b-b007-4895-8b62-4be5ebe2a981/stiahnut/?force=false"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-07",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Цитата дословна. База 17,1%: 9,2/17,1 = 53,8% — верно. Все авторы из Microsoft — C, незачёт подтверждаю. Выборочная проверка (25%)."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/pdf/2401.10956"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-2-08",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Цитата дословна (аннотация). 3 из 4 авторов — Microsoft Research. Рандомизацию и телеметрию вела Microsoft («The Microsoft side randomized treatment assignment… and used the anonymized identifiers to track telemetry data»). 66 фирм не названы. C и незачёт подтверждаю.",
    "Уточнение: NBER WP не рецензирован. Благодарность «3 anonymous referees» указывает на журнальное рецензирование, но журнальную версию проверяющий не искал. Лицензии Copilot фирмы покупали сами (300 мест) — это конфликт интересов поставщика."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.nber.org/system/files/working_papers/w33795/w33795.pdf"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-WORK-2-09"
 ],
 "packet_notes_ru": "Системные ошибки автора. (1) Аффилиации проверены по формальным признакам, а не по сноскам. В 01 пропущен соавтор из Ant Group (Shuo Shan), и на этом ложном основании поставлен уровень A. В 02 соавторов из Alibaba двое, а не один. В 04 не учтены патенты авторов на модель. (2) Изменение работы не отделено от эксперимента на сконструированных заданиях. Нацбанк Словакии (06): 2-часовая оплачиваемая сессия, придуманные 4-минутные задания — зачёт снят (как BCG в W8-FIELD-WORK-05). У ЦБ Ирландии (05) задания тоже сконструированы. (3) Лог-пункты выданы за проценты (01: 55 лог-п. ≈ 73%; 02: −0,082 ≈ −7,9%). В 06 эффект 0,24 SD на рутинных задачах выдан за средний. (4) Дата препринта 02 указана по последней редакции (2026-07), а первая публикация — SSRN 06.11.2024. Итог: в 120 подтверждаются 3 из 4 предложенных — 01 (понижен A→B), 02 и 03 (B, mixed). Все три держатся на прецеденте W8-FIELD-WORK-01 (академическое измерение с меньшинством соавторов из компании = B без второго источника). Строго по v0.4 разд. 7 для B нужно независимое подтверждение — нужно решение координатора. 02 и 03 — отдельные рандомизации и статьи; засчитывать раздельно с флагом shared_origin (группа Wang/Feng/Lu + Alibaba, один процесс Taobao), взаимным подтверждением не считать. 04 понижен до C. 09 (D, первоисточник за платным доступом) не проверялся. WebSearch: использовано 3 из 10. Черновики (PDF/txt) — в packets/W8-FIELD-WORK-2/vdraft/."
}