{
 "packet_id": "W8-FIELD-WORK-3",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T18:00:00+03:00",
 "entities": [
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2607.28222",
     "publisher": "arXiv (Jabarian, Henkel)",
     "published": "2026-09-11",
     "origin": "academic",
     "quote_original": "Disclosure: The partner firm supplied the data but had no role in analyses, manuscript preparation, or the decision to publish.",
     "quote_ru": "Раскрытие: фирма-партнёр предоставила данные, но не участвовала в анализе, подготовке рукописи и решении о публикации."
    },
    {
     "url": "https://arxiv.org/pdf/2607.28222",
     "publisher": "arXiv (Jabarian, Henkel)",
     "published": "2026-09-11",
     "origin": "academic",
     "quote_original": "The pre-registered data collection was completed on June 7, 2025. Nearly two months later, on August 1, 2025, Brian Jabarian accepted an unpaid role as Chief Economist at PSG Global Solutions (a Teleperformance subsidiary)",
     "quote_ru": "Предрегистрированный сбор данных завершён 7 июня 2025 г. Почти через два месяца, 1 августа 2025 г., Брайан Джабариан принял неоплачиваемую должность главного экономиста PSG Global Solutions (дочерней компании Teleperformance)."
    },
    {
     "url": "https://arxiv.org/pdf/2607.28222",
     "publisher": "arXiv (Jabarian, Henkel)",
     "published": "2026-09-11",
     "origin": "academic",
     "quote_original": "Our full sample consists of 70,884 applications that the firm received from March 7 to June 7, 2025.",
     "quote_ru": "Полная выборка — 70 884 заявки, полученные фирмой с 7 марта по 7 июня 2025 г."
    },
    {
     "url": "https://arxiv.org/pdf/2607.28222",
     "publisher": "arXiv (Jabarian, Henkel)",
     "published": "2026-09-11",
     "origin": "academic",
     "quote_original": "In 7% of AI-led interviews, the interview is aborted due to a technical failure of the AI voice agent, and in 5% of interviews, the applicant explicitly expresses the unwillingness to continue speaking with the AI voice agent.",
     "quote_ru": "В 7% интервью с ИИ разговор прерывался из-за технического сбоя голосового агента, а в 5% кандидат прямо отказывался продолжать разговор с ИИ."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-01",
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": true,
   "issues_ru": [
    "Полный PDF arXiv 2607.28222v2 (10.09.2026) открыт и прочитан (pdftotext): автор напрасно опирался на ERE и пресс-релиз EUR — первичный текст доступен.",
    "Независимость. Соавторы не сотрудники вендора ИИ-интервью. Партнёр — PSG Global Solutions (RPO, дочерняя компания Teleperformance), она же пользователь ИИ-агента; инфраструктуру дал Google Cloud. Раскрытие: партнёр дал данные, но не участвовал в анализе и в решении о публикации. Сбор предрегистрированных данных (AEA #15385) завершён 07.06.2025; 01.08.2025 Jabarian стал неоплачиваемым Chief Economist PSG и продлил партнёрство на пять лет. Конфликт возник после сбора данных, но его нужно указать в level_basis. Происхождение данных одно (административные данные PSG); по прецеденту (а) B допустим, A — нет.",
    "Аффилиация Jabarian в v2: Carnegie Mellon University (CAAI), а не Chicago Booth, как пишет автор; соглашение о данных оформлено через Booth.",
    "Период уточнён: заявки 7 марта — 7 июня 2025 г., 70 884 заявки (67 056 рандомизированы: 40 103 ИИ, 13 557 человек, 13 396 выбор), 48 вакансий, 41 клиент.",
    "Арифметика: 1 179/13 557 = 8,70%; 3 904/40 103 = 9,73%; отношение 1,119 → +12% (подтверждено). Выход на работу 766→5,65% против 2 691→6,71% (+18,8%). Удержание 1 мес.: 675→4,98% против 2 363→5,89% (+18,3%). В статье +18% (а не 17%, как у автора) для удержания ≥1 месяца.",
    "«Без снижения продуктивности» — отсутствие значимых различий в AHT, CSAT и QA по подвыборке нанятых, а не рост продуктивности.",
    "7% — доля ИИ-интервью, прерванных технической ошибкой агента (Appendix); ещё 5% кандидатов явно отказывались продолжать разговор с ИИ. Это следует добавить в контрдоказательства.",
    "Решения о найме принимают рекрутеры-люди, оценивающие записи интервью; ИИ заменил проведение первичного интервью — изменение работы установлено. По данным поиска (Chicago Booth Review) PSG планирует глобальное развёртывание — это заявленное намерение, не измеренный исход.",
    "Quote_original из ERE («PSG Global Solutions... entry-level customer service roles in the Philippines») с многоточием — не проверен дословно; заменить цитатой из первичного PDF (добавлена ниже)."
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2607.28222",
    "https://arxiv.org/pdf/2607.28222"
   ]
  },
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2510.12049",
     "publisher": "arXiv (Fang, Yuan, Zhang, Donati, Sarvary), v6",
     "published": "2026-06-29",
     "origin": "academic",
     "quote_original": "Lu Fang and Zhe Yuan served as consultants for the partner company during the duration of the project. Kaifu Zhang was an employee of the partner company during the duration of the project.",
     "quote_ru": "Лу Фан и Чжэ Юань были консультантами компании-партнёра на протяжении проекта. Кайфу Чжан был сотрудником компании-партнёра на протяжении проекта."
    },
    {
     "url": "https://arxiv.org/pdf/2510.12049",
     "publisher": "arXiv, v6",
     "published": "2026-06-29",
     "origin": "academic",
     "quote_original": "Across the five processes with detailed data, sales effects range from no detectable impact in the advertising workflows to gains of up to 16.3% in the Pre-sale Service Chatbot.",
     "quote_ru": "В пяти процессах с детальными данными эффект на продажи — от необнаружимого в рекламных процессах до +16,3% у предпродажного чат-бота."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-02",
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Независимость не подтверждена: раскрытие в актуальной версии v6 (29.06.2026) — «Lu Fang and Zhe Yuan served as consultants for the partner company during the duration of the project. Kaifu Zhang was an employee of the partner company». Три из пяти авторов, включая корреспондирующего, связаны с компанией; без связи — только Donati (Columbia) и Sarvary. Данные — компании, компания анонимна. Прецедент (а) требует большинства внешних авторов и названной организации; здесь нет ни того, ни другого. Автор ошибочно назвал всех авторов независимыми, а пометку «Partner Company» у Zhang счёл артефактом извлечения — это прямое указание на сотрудника.",
    "Главная ошибка исхода: −4,5% продаж по Google Advertising Title статистически незначимо (коэфф. −0,00602, SE 0,00534); сами авторы пишут «no detectable impact in the advertising workflows». Формулировка «падение продаж в одном процессе» неверна. Негатив в этом процессе всё же есть: просмотры −7,68% и клики −10,26% (оба p<0,01, Table C8). Marketing Push +1,6% тоже незначим. Исход mixed сохраняю, но по трафику рекламы, а не по продажам.",
    "Период подтверждён: сентябрь 2023 — июнь 2024. Заголовок в v6 изменился на «Generative AI and Sales Productivity: Field Experiments in Online Retail». Автор цитирует v4 со старым названием и датой 01.06.2026 (v4 — 01.06, v5 — 02.06, v6 — 29.06.2026).",
    "Chargeback Defense (+15%) и Live Chat Translation (+5,2% удовлетворённости) — без детальных данных; второе — самооценка потребителей.",
    "Количественный вклад: ≈4,6–5,2 долл. на потребителя в год — это оценка авторов «back-of-the-envelope», а не измеренный финансовый результат."
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2510.12049",
    "https://arxiv.org/pdf/2510.12049",
    "https://arxiv.org/html/2510.12049v4"
   ]
  },
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://arxiv.org/html/2606.03095",
     "publisher": "arXiv (Mahinpei, Dean, Fong, Liu, Horta Ribeiro)",
     "published": "2026-06-02",
     "origin": "academic",
     "quote_original": "We conducted our study in a 300-level undergraduate machine learning (ML) course (“Course X”) at a private R1 university.",
     "quote_ru": "Исследование проведено в курсе машинного обучения 300-го уровня («Курс X») в частном исследовательском университете R1."
    },
    {
     "url": "https://arxiv.org/html/2606.03095",
     "publisher": "arXiv",
     "published": "2026-06-02",
     "origin": "academic",
     "quote_original": "We develop a lightweight, LLM-backed Chrome extension that surfaces personalized feedback drafts directly within TAs’ native grading platform.",
     "quote_ru": "Мы разработали лёгкое Chrome-расширение на основе LLM, которое показывает персонализированные черновики фидбека прямо в штатной платформе проверки ассистентов."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-03",
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Реальная работа организации — да: 11 ассистентов (7 GTA, 4 UTA) реального курса ML 300-го уровня, штатный процесс проверки в Gradescope, осень 2025, предрегистрация OSF, IRB 18396. Прецедент (б) неприменим.",
    "Но происхождение одно и нет независимости: все пять авторов из Princeton; они же разработали инструмент (Chrome-расширение на o4-mini) и провели оценку на курсе своего университета. «Данные организации + анализ её сотрудников» = одно происхождение (урок 23.09), и к тому же разработчик = оценщик. Уровень A не заслужен.",
    "Курс в статье анонимизирован: «Course X» «at a private R1 university». Quote_original автора «Princeton University, USA... a 300-level undergraduate machine learning (ML) course... Fall 2025» склеен из аффилиаций авторов и описания курса — не дословно; принадлежность курса Princeton — вывод, а не цитата.",
    "Масштаб — пилот: один курс, один семестр, 88 студентов из обычных 130–150 (согласие), 11 TA. Последующее внедрение в университете не показано, поэтому изменение работы организации не установлено.",
    "Исход: success по критерию исследования (+10,8 п.п. к доле фидбека, +39,8 символа, без снижения оценок полезности). Нулевой эффект на время на символ — не отрицательный результат; mixed у автора не обоснован.",
    "Цифры 10,8 п.п. (SE 1,1), 39,8 символа (SE 3,45) и отсутствие снижения времени на символ подтверждены в аннотации."
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2606.03095",
    "https://arxiv.org/html/2606.03095"
   ]
  },
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://nousgroup.com/case-studies/copilot-comes-to-canberra",
     "publisher": "Nous Group",
     "published": "не указана",
     "origin": "company",
     "quote_original": "We were engaged by the Digital Transformation Agency to evaluate the trial, testing the extent to which the promise of AI had translated into real-world adoption by public servants.",
     "quote_ru": "DTA наняло нас для оценки пилота: мы проверяли, насколько обещания ИИ воплотились в реальное использование госслужащими."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-04",
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Дубль CAND-689ace7873042b99 (E4A-OTHER-02, прежний проверяющий: C/mixed). Объединить; новую сущность не считать.",
    "Новые данные причин уровня C не закрывают. Страница Nous Group — кейс-маркетинг самого подрядчика оценки: «We were engaged by the Digital Transformation Agency to evaluate the trial». Это то же происхождение, что и официальный отчёт DTA (Nous помогала DTA его готовить), а не независимое подтверждение. Слова «independent» на странице Nous нет.",
    "Официальная оценка DTA (digital.gov.au) существует, прежний проверяющий открыл её через Wayback: пилот не рандомизирован, агентства сами выдвигали участников, есть selection bias, показатели — самоотчёт. Отдельной независимой оценки (ANAO и т. п.) поиск не нашёл: ANAO упоминается лишь как участник пилота и в аудите ИИ в ATO.",
    "Quote_original автора «Nous Group conducted the evaluation, engaged by the Digital Transformation Agency.» на странице отсутствует — это перефраз. Дословно: «We were engaged by the Digital Transformation Agency to evaluate the trial».",
    "Цифры 69%, 61%, до 1 ч/день, 77%, 86%, «1 in 3 daily», январь–июнь 2024, 5000+ сотрудников, ~60 агентств на странице Nous подтверждены; все они — самооценка участников."
   ],
   "sources_opened": [
    "https://nousgroup.com/case-studies/copilot-comes-to-canberra"
   ]
  },
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2502.08501",
     "publisher": "arXiv (Grimon, Mills), v3",
     "published": "2026-02-18",
     "origin": "academic",
     "quote_original": "The trial ran for 17 months from November 1, 2020 to March 29, 2022.",
     "quote_ru": "Испытание длилось 17 месяцев — с 1 ноября 2020 г. по 29 марта 2022 г."
    },
    {
     "url": "https://arxiv.org/pdf/2502.08501",
     "publisher": "arXiv (Grimon, Mills), v3",
     "published": "2026-02-18",
     "origin": "academic",
     "quote_original": "significant or nearly significant for the two outcomes where we have highest power (p = 0.112 for high priority visits and p = 0.068 for injuries)",
     "quote_ru": "значимы или почти значимы для двух исходов с наибольшей мощностью (p = 0,112 для приоритетных визитов и p = 0,068 для травм)"
    },
    {
     "url": "https://arxiv.org/pdf/2502.08501",
     "publisher": "arXiv (Grimon, Mills), v3",
     "published": "2026-02-18",
     "origin": "academic",
     "quote_original": "Random forests and XGBoost were considered for the algorithm, but a LASSO regularized logistic regression specification was chosen for runtime purposes.",
     "quote_ru": "Для алгоритма рассматривались случайный лес и XGBoost, но ради скорости работы выбрана логистическая регрессия с LASSO-регуляризацией."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-06",
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "ИИ = ML подтверждено: инструмент CSDA (Vaithianathan) — LASSO-регуляризованная логистическая регрессия, обученная на ≈500 000 обращений 2010–2014 гг. (рассматривались random forest и XGBoost); в тексте назван «machine learning tool». Прогнозирует помещение ребёнка в приёмную семью в течение двух лет. Это классическая предиктивная ML-модель (не генеративный ИИ).",
    "Исход измерен в реальной работе: 4 681 ребёнок по 2 832 реальным обращениям; госпитализации — по связанным данным Colorado Hospital Association (январь 2020 — июнь 2022). Это иное происхождение, чем данные агентства, — плюс.",
    "ГЛАВНОЕ: период испытания — 1 ноября 2020 — 29 марта 2022 г. (17 мес.), вне основного окна поиска (с 2023 г.). Автор не нашёл даты и не применил тот же критерий, по которому исключил W8-FIELD-WORK-3-09 (2021). Для последовательности counted_in_120=false; при исключении координатора (раннее основание) допустимо B/success.",
    "Переоценка эффекта: снижение травматических госпитализаций на 21% (0,03 при среднем 0,17) статистически незначимо на 5%-м уровне (p=0,068). Значим только совокупный индекс вреда: −0,05 SD, p=0,046 — пограничная значимость. Заголовок «снижение госпитализаций на 21%» надо сопровождать этой оговоркой.",
    "Уровень A → B: агентство и округ анонимизированы («trial county»); препринт не рецензирован; исследование входит в «wider research program... led by Rhema Vaithianathan and Emily Putnam-Hornstein», то есть разработчиков инструмента (авторы внешние, но связь с программой разработчика есть).",
    "Цитата автора «21 percent reduction in injury-related hospitalizations» дословна; версия v3 датирована 18.02.2026 (arXiv) / 19.02.2026 (титул)."
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2502.08501",
    "https://arxiv.org/pdf/2502.08501"
   ]
  },
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://www.udel.edu/content/dam/udelImages/star/fintech-innovation-hub/XingLiu_AI_Insurance_20240407.pdf",
     "publisher": "Xing Liu (working paper, University of Delaware FinTech Hub)",
     "published": "2024-04",
     "origin": "academic",
     "quote_original": "The experiment I analyze was conducted by the agency on its mobile app from August 9 to November 16, 2021.",
     "quote_ru": "Анализируемый эксперимент агентство провело в своём мобильном приложении с 9 августа по 16 ноября 2021 г."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-09",
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Период найден в открытом PDF: эксперимент проводило агентство в приложении с 9 августа по 16 ноября 2021 г. (≈11 000 агентов) — вне окна. Исключение из 120 подтверждаю; автору следовало найти дату в тексте, а не ссылаться на сниппеты.",
    "Цифры +14% (по суммарной премии, относительно контроля) и рост неблагоприятного отбора подтверждены; исход mixed обоснован.",
    "Уровень B условный: один автор, данные компании (одно происхождение), компания анонимна, working paper апреля 2024 г."
   ],
   "sources_opened": [
    "https://www.udel.edu/content/dam/udelImages/star/fintech-innovation-hub/XingLiu_AI_Insurance_20240407.pdf"
   ]
  },
  {
   "checked": true,
   "added_evidence": [],
   "entity_id": "W8-FIELD-WORK-3-10",
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Аннотация arXiv 2503.18238 (v3, 05.02.2026) подтверждает: Pairit — платформа, созданная авторами; 2 234 участника, 11 024 объявления, ~5 млн показов в X; +50% объявлений на работника, лучше текст, хуже изображения, гомогенизация.",
    "Это не изменение работы существующей организации: набранные участники выполняли придуманное исследователями задание (прецедент (б)). Уровень как кейса организации — C/вне области, а не B; out_of_scope и исключение из 120 подтверждаю."
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2503.18238"
   ]
  },
  {
   "checked": true,
   "added_evidence": [
    {
     "url": "https://arxiv.org/abs/2507.08029",
     "publisher": "arXiv (Aka, Palikot, Ansari, Yazdani)",
     "published": "2026",
     "origin": "company",
     "quote_original": "The participation cost falls on applicants as 75 percent of invited candidates do not complete the interview.",
     "quote_ru": "Издержки участия ложатся на соискателей: 75% приглашённых кандидатов не завершают интервью."
    }
   ],
   "entity_id": "W8-FIELD-WORK-3-05",
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Аннотация arXiv 2507.08029 открыта. Среди авторов Ali Ansari — основатель и CEO micro1 (продавец инструмента; по общеизвестным данным), то есть данные и оценка идут от вендора. C и исключение подтверждаю.",
    "Исход скорее mixed, чем success: аннотация фиксирует, что 75% приглашённых кандидатов не проходят ИИ-интервью, а издержки отбора переходят на соискателей; эффект +17,5 п.п. (SE 8,5) и +20 п.п. (SE 11,8) — с широкими ошибками (второй — незначим на 5%-м уровне)."
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2507.08029"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-WORK-3-07",
  "W8-FIELD-WORK-3-08"
 ],
 "packet_notes_ru": "Фактическое число вызовов WebSearch: 2 (из 10). Первичные PDF открыты через curl (User-Agent Mozilla/5.0) и pdftotext; черновики — в packets/W8-FIELD-WORK-3/vdraft. Системные ошибки автора: (1) независимость авторов принята без чтения раскрытий конфликтов интересов — у 02 три из пяти авторов связаны с компанией, у 01 соавтор после сбора данных стал Chief Economist PSG, у 03 авторы — разработчики инструмента из той же организации; (2) незначимые эффекты поданы как измеренные изменения (02: −4,5% продаж, p>0,1; 06: −21% госпитализаций, p=0,068); (3) окно 2023+ применено непоследовательно: 09 (2021) исключён, а 06 (ноябрь 2020 — март 2022) предложен в 120, хотя даты есть в тексте; (4) склеенные и перефразированные quote_original (03, 04, ERE-цитата в 01); (5) 04 — дубль CAND-689ace7873042b99, страница Nous — то же происхождение, что и отчёт DTA. Итог: из 5 предложенных в 120 подтверждён 1 (01, B/success); 02, 03, 04 → C; 06 → B/success, но вне окна (решение за координатором). 07 и 08 (D/unknown, не предлагались) не проверялись; из необязательных проверен 05 (1 из 3)."
}