{
 "packet_id": "E4A-OTHER-06",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T00:00:00Z",
 "entities": [
  {
   "entity_id": "CAND-a5840cf57971555b",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "mixed",
   "counted_in_120": true,
   "issues_ru": [
    "Это реальное внедрение, а не только эксперимент: ИИ-ассистент поэтапно развёрнут в рабочем процессе поддержки анонимной компании из Fortune 500 (разработчик ПО для бизнес-процессов МСБ в США). До развёртывания был семинедельный рандомизированный пилот на 50 операторах; основная часть внедрения пришлась на ноябрь 2020 – февраль 2021. Метод — ступенчатый DiD/event-study на рабочих данных, не лабораторное задание. Цитата NBER w31161: «The AI assistant we study was gradually rolled out at the agent level after an initial seven-week randomized pilot featuring 50 agents… The bulk of the adoption occurs between November 2020 and February 2021».",
    "Рецензирование подтверждено: QJE 140(2):889–942, 2025, DOI 10.1093/qje/qjae044 (IDEAS/RePEc, Crossref в W8). Аннотация QJE дословно: «increases worker productivity, as measured by issues resolved per hour, by 15% on average… the most experienced and highest-skilled workers see small gains in speed and small declines in quality».",
    "Исход mixed обоснован, и это точнее W8-FIELD-WORK-04 (success). W8 опирался на средние эффекты рабочей версии: по NPS изменения нет, по resolution rate +1,3 п.п. Однако в той же рабочей версии есть прямая фраза: «For the highest-skilled workers, we find mixed results… a small but statistically significant decreases in resolution rates and customer satisfaction». По правилу v0.4 §7 разнонаправленные результаты сохраняются как mixed. Вывод согласован: mixed.",
    "Уровень понижен с A до B, как в W8-FIELD-WORK-04. Независимость авторов не означает независимости происхождения данных. Все данные — одна фирма, получены через поставщика ИИ-инструмента («We work with a company that provides AI-based customer service support software… to study the deployment of their tool at one of their client firms»). NBER сообщает: «At least one co-author has disclosed additional relationships». Второго источника результата с другим происхождением данных нет. Рецензирование подтверждает метод, но не даёт независимых данных. Определение A из v0.4 §7 («независимое подтверждение результата») не выполнено.",
    "Зачёт: B, исход mixed установлен, роль ИИ в изменении работы измерена на реальном процессе. Зачёт возможен как отдельная сущность. Карточка W8-FIELD-WORK-04 остаётся незасчитанным дубликатом (adjudications.json). Для координатора: период внедрения 2020–2021 предшествует основному периоду поиска v0.4 (2023). Окно 2023–2026 было жёстким только для W8, для E4A — нет. Нужно подтвердить релевантность раннего кейса решением координатора: инструмент построен на GPT до ChatGPT.",
    "Подрядчики: часть операторов работает через сторонние фирмы, в основном на Филиппинах («both directly and through third-party firms»). Автор карточки этого не отметил.",
    "Мелкие уточнения к карточке автора: эффект у опытных операторов в рабочей версии статистически значим по двум метрикам качества (resolution rate, NPS), а не только упомянут в аннотации. Поздних опровержений или откатов поиск не нашёл. Это не доказывает их отсутствия."
   ],
   "added_evidence": [
    {
     "url": "https://www.nber.org/system/files/working_papers/w31161/w31161.pdf",
     "publisher": "NBER Working Paper 31161",
     "published": "2023-04 (ред. 2023-11)",
     "origin": "academic (данные фирмы, полученные через поставщика ИИ)",
     "quote_original": "For the highest-skilled workers, we find mixed results: a zero effect on average handle time (Panel A), a positive effect for chats per hour (Panel B), and, interestingly, a small but statistically significant decreases in resolution rates and customer satisfaction (Panels C and D).",
     "quote_ru": "Для самых квалифицированных работников результаты смешанные: нулевой эффект по среднему времени обработки, положительный по числу чатов в час и небольшое, но статистически значимое снижение доли решённых обращений и удовлетворённости клиентов."
    },
    {
     "url": "https://www.nber.org/system/files/working_papers/w31161/w31161.pdf",
     "publisher": "NBER Working Paper 31161",
     "published": "2023-04 (ред. 2023-11)",
     "origin": "academic",
     "quote_original": "It employs a variety of chat-based technical support agents, both directly and through third-party firms. The majority of agents in our sample work from offices located in the Philippines",
     "quote_ru": "Компания привлекает операторов чат-поддержки как напрямую, так и через сторонние фирмы; большинство операторов выборки работают в офисах на Филиппинах."
    }
   ],
   "sources_opened": [
    "https://ideas.repec.org/a/oup/qjecon/v140y2025i2p889-942..html",
    "https://www.nber.org/system/files/working_papers/w31161/w31161.pdf",
    "WebSearch: критика/репликация Generative AI at Work — новых материалов нет"
   ]
  },
  {
   "entity_id": "CAND-a0180759f6a99a56",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Это не исход работы организации, а результат однодневного рандомизированного эксперимента-воркшопа. Задания реальные («develop product ideas, packaging, retail strategies… for the business units they really worked for»), но измеряется оценка экспертами решений, подготовленных за один день. Внедрения ИИ в рабочий процесс P&G, запуска продуктов или изменения работы подразделений в источниках нет. Моллик: лучшие идеи «submitted to management for approval», их дальнейшая судьба не раскрыта. Результат эксперимента не равен исходу работы организации без внедрения.",
    "Происхождение данных одно: единственный эксперимент в одной компании, проведённый исследователями HBS/Wharton/ESSEC/Warwick при участии четырёх сотрудников P&G в соавторстве. Блог Моллика — пересказ соавтора, то есть то же происхождение, а не подтверждение. Моллик пишет, что компания «had no control over the results or data», но это заявление самих авторов.",
    "Рецензирование подтверждено: Organization Science, vol. 37(4), DOI 10.1287/orsc.2025.20702 (Crossref). Расхождения с карточкой: по Crossref онлайн-публикация — июль 2026, а не июнь, как на странице NBER. Выборка в рецензируемой аннотации — 791 профессионал, а не 776, как в рабочей версии. Зафиксировать обе цифры.",
    "Уровень B для экспериментального вывода (пререгистрированное РКИ, прозрачная методика, рецензирование) допустим. Как кейс изменения работы организации он не проходит: исход по организации — unknown, роль ИИ в изменении реальной работы не установлена. Засчитывать нельзя. Можно использовать как контекстное научное свидетельство о механизме, вне 120.",
    "Арифметика и подписи: 0,24 SD — это эффект команд без ИИ относительно базы «индивиды без ИИ», а не сама база. В карточке baseline подписан как «команды без ИИ = 0,24 SD», и это вводит в заблуждение. Разности 0,13 и 0,15 SD посчитаны верно, но статистическая значимость разницы «индивид с ИИ против команды без ИИ» в открытых материалах не показана. Авторы формулируют это как «matched», то есть не хуже, а не «превзошли».",
    "Поздних материалов о внедрении ИИ-процесса в P&G по итогам эксперимента поиск не нашёл; есть только вторичные пересказы (BABL AI, PYMNTS, CDO Times)."
   ],
   "added_evidence": [
    {
     "url": "https://api.crossref.org/works/10.1287/orsc.2025.20702",
     "publisher": "Crossref / INFORMS Organization Science",
     "published": "2026-07 (vol. 37, issue 4)",
     "origin": "academic",
     "quote_original": "field experiment with 791 professionals at Procter & Gamble… individuals with AI matched the performance of teams without AI",
     "quote_ru": "полевой эксперимент с 791 профессионалом P&G… индивиды с ИИ сравнялись по результативности с командами без ИИ"
    },
    {
     "url": "https://www.oneusefulthing.org/p/the-cybernetic-teammate",
     "publisher": "One Useful Thing (Э. Моллик, соавтор)",
     "published": "2025-03-22",
     "origin": "academic (пересказ соавтора, то же происхождение)",
     "quote_original": "We ran one-day workshops where professionals from Europe and the US had to actually develop product ideas, packaging, retail strategies and other tasks for the business units they really worked for",
     "quote_ru": "Мы провели однодневные воркшопы, где специалисты из Европы и США разрабатывали продуктовые идеи, упаковку, розничные стратегии и другие задачи для бизнес-единиц, в которых действительно работали"
    }
   ],
   "sources_opened": [
    "https://www.nber.org/papers/w33641",
    "https://www.oneusefulthing.org/p/the-cybernetic-teammate",
    "https://api.crossref.org/works/10.1287/orsc.2025.20702",
    "WebSearch: P&G Cybernetic Teammate rollout"
   ]
  },
  {
   "entity_id": "CAND-b43166731c8b696b",
   "checked": true,
   "verdict": "needs_rework",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Уровень C и незачёт подтверждаю: все цифры получены из заявлений руководителей Magalu 07.07.2026 (CEO Фредерико Трахано, Рикарду Кейрину) и совпадают в перепечатках одного дня. Исход success — только по критерию компании.",
    "Цитата-свидетельство из Money Times не найдена в статье: «Os números... provêm de declarações dos executivos entrevistados, não de auditoria independente...». При открытии статьи (автор Lorena Matos, 07.07.2026) такой фразы в ней нет. Скорее всего, это вывод инструмента-пересказчика, оформленный как quote_original. Заменить её дословной цитатой или убрать.",
    "Финансовая метрика: Money Times пишет «movimentou R$ 100 milhões», то есть оборот, проведённый через канал (ближе к GMV), а не выручку; TI Inside пишет «100 milhões de reais em vendas». Не смешивать с выручкой Magalu. Валюта — BRL, период — с ноября 2025 по июль 2026, базы нет.",
    "«7 milhões de interações» (Money Times) и «7,7 milhões de usuários únicos» (TI Inside) — разные метрики, а не расхождение одной цифры. NPS 84,5 и «em torno de 85» совместимы: второе — округление.",
    "Конверсия «в три раза выше других цифровых каналов» — заявление без метода. Отбор аудитории канала может объяснять разницу без вклада ИИ."
   ],
   "added_evidence": [
    {
     "url": "https://www.moneytimes.com.br/exclusivo-magazine-luiza-mglu3-fatura-r-100-milhoes-com-whatsapp-da-lu-menos-de-um-ano-apos-lancamento-lmrs/",
     "publisher": "Money Times",
     "published": "2026-07-07",
     "origin": "пересказ заявлений компании",
     "quote_original": "O Magazine Luiza (MGLU3) movimentou R$ 100 milhões com o 'WhatsApp da Lu' desde o lançamento da ferramenta, em novembro de 2025.",
     "quote_ru": "Magazine Luiza провела через «WhatsApp da Lu» R$ 100 млн с момента запуска инструмента в ноябре 2025 года."
    }
   ],
   "sources_opened": [
    "https://www.moneytimes.com.br/exclusivo-magazine-luiza-mglu3-fatura-r-100-milhoes-com-whatsapp-da-lu-menos-de-um-ano-apos-lancamento-lmrs/",
    "https://tiinside.com.br/07/07/2026/magalu-vende-mais-de-r-100-milhoes-por-whatsapp/"
   ]
  },
  {
   "entity_id": "CAND-bb36978bd1cc8d53",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Цифры в посте Grab (Maanas Prabhakar, 01.08.2026) подтверждены: 44%→30% механических тикетов (февраль → июнь); самостоятельная обработка 53→67, 63→90, 50→81% (март → май); сокращение цикла примерно на 33%. Экономия 230–470 дней — контрфактическая оценка, а не измерение, и в карточке она отмечена верно.",
    "Самоотчёт компании за 4–5 месяцев, без независимого подтверждения. Grab сама признаёт неровный прогресс («we expect to get a fair amount of it wrong»). Уровень C, зачёта нет.",
    "Замечание к оформлению: evidence InfoQ содержит в quote_original вывод автора на русском, а не цитату. Исправить."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://engineering.grab.com/how-ai-is-transforming-analytics"
   ]
  },
  {
   "entity_id": "CAND-a8e6cb59dc03d2d6",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Страница Allianz от 03.11.2025 подтверждает: «80% reduction in claim processing and settlement time»; запуск в июле 2025; претензии до AUD 500 по порче продуктов после отключений электроэнергии в Австралии; семь агентов; окончательное решение о выплате принимает человек («Payout decisions are never automated»).",
    "Базы, числа обработанных претензий и метода расчёта 80% нет. Это самоотчёт компании, и The Digital Insurer его пересказывает. Уровень C, success только по критерию компании, зачёта нет."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.allianz.com/en/mediacenter/news/articles/251103-when-the-storm-clears-so-should-the-claim-queue.html"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "CAND-985a86443e80ed09",
  "CAND-a1df755499c17233",
  "CAND-abe5275b71223982"
 ],
 "packet_notes_ru": "Проверены 5 из 8 сущностей: обязательные — NBER, P&G и Magalu (финансовые числа) — и 2 из 5 остальных (40%: Grab, Allianz). Системные ошибки автора. (1) В quote_original попадают выводы автора или инструмента-пересказчика вместо дословных цитат. Для Money Times фраза в статье не найдена, для InfoQ цитата написана по-русски; нужна выборочная перепроверка цитат по пакету. (2) Независимость авторов и рецензирование принимаются за независимость происхождения данных. Для NBER A понижен до B, данные одной фирмы получены через поставщика ИИ, это согласовано с W8-FIELD-WORK-04. (3) Результат однодневного эксперимента P&G засчитан как исход работы организации, хотя внедрения нет; зачёт отклонён. По NBER исход mixed подтверждён рабочей версией: статистически значимое снижение resolution rate и NPS у самых квалифицированных операторов. Итог по зачёту: 1 (CAND-a5840cf57971555b, B, mixed) вместо 2. Координатору нужно решить, релевантен ли период внедрения 2020–2021. WebSearch использован 2 раза из 4."
}