{
 "packet_id": "E4A-UNK-01",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T00:00:00Z",
 "entities": [
  {
   "entity_id": "CAND-e9b84d5ad1661a54",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "B",
   "outcome": "failure",
   "counted_in_120": true,
   "issues_ru": [
    "Цитаты и числа подтверждены по PDF приказа SEC (Release No. 11352 / 102177, File No. 3-22413, 14.01.2025): п.26 «approximately 70% of the time during the time period of June 2023 through at least December 2023»; исходная версия — вмешательство человека «in all instances»; агенты на Филиппинах и в Индии; раскрытие Presto «over 70% of orders ... require human agent intervention» и средний non-intervention 85% (14.12.2023).",
    "Приказ действительно устанавливает факт о роли людей и ИИ в операции приёма заказов: это выводы Комиссии (findings), а не пересказ СМИ. Ограничение: приказ урегулирования, Presto согласилась «without admitting or denying the findings»; методика измерения ~70% в приказе не раскрыта.",
    "Уровень A не заслужен: A требует первичных данных с прозрачным измерением. Здесь вывод регулятора плюс раскрытия самой компании в Form 8-K, которые регулятор цитирует. Два происхождения есть: регулятор и вынужденное раскрытие компании. Прозрачного измерения нет, поэтому уровень B.",
    "Автор пропустил существенный факт из приказа: с ноября 2021 по сентябрь 2022 все коммерчески развёрнутые блоки Presto Voice работали на ИИ стороннего поставщика (Supplier A), и компания это не раскрывала. Роль «собственного ИИ Presto» до сентября 2022 в карточке надо исправить.",
    "Исход failure относится к заявленной цели компании (автоматический приём заказов без людей, 95–99%) и к фактическому процессу, а не только к раскрытию. Зачёт в 120 подтверждаю как отрицательный случай уровня B. Денежного штрафа не было; делистинг не приписывать делу SEC."
   ],
   "added_evidence": [
    {
     "url": "https://www.sec.gov/files/litigation/admin/2025/33-11352.pdf",
     "publisher": "U.S. Securities and Exchange Commission",
     "published": "2025-01-14",
     "origin": "regulator",
     "quote_original": "From at least November 2021 to September 2022, the only Presto Voice units that Presto commercially deployed were powered by the voice AI technology and components owned and operated by Supplier A.",
     "quote_ru": "По меньшей мере с ноября 2021 по сентябрь 2022 года все коммерчески развёрнутые Presto блоки Presto Voice работали на голосовой ИИ-технологии и компонентах, принадлежащих стороннему поставщику A и управляемых им."
    },
    {
     "url": "https://www.sec.gov/files/litigation/admin/2025/33-11352.pdf",
     "publisher": "U.S. Securities and Exchange Commission",
     "published": "2025-01-14",
     "origin": "regulator",
     "quote_original": "without admitting or denying the findings",
     "quote_ru": "не признавая и не оспаривая выводы (формула урегулирования)"
    }
   ],
   "sources_opened": [
    "https://www.sec.gov/files/litigation/admin/2025/33-11352.pdf"
   ]
  },
  {
   "entity_id": "CAND-1cb9741d9f24b082",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Фактическая ошибка в оценке независимости: соавторов из Alibaba Group двое (Yitong Wang и Congyi Zhou, сноска «e Alibaba Group Inc.»), а не один. Независимых авторов четверо из шести: Fudan ×2, Zhejiang, Dartmouth Tuck.",
    "Данные имеют одно происхождение. По тексту статьи эксперимент провела сама компания («Alibaba conducted a four-week randomized A/B test»), а данные взяты из телеметрии Alibaba («In collaboration with Alibaba»). Внешние соавторы независимо анализируют данные, но не дают независимого подтверждения исхода. Препринт не рецензирован: arXiv 2603.29888, ранее SSRN 5012601; журнальной публикации поиск не нашёл. Второго независимого источника нет. По правилу B («подтверждение ключевого исхода другим независимым источником») выходит уровень C. Так же автор пакета оценил INSEAD (авторы полностью независимы, уровень C) и MS Copilot; решение по Alibaba выбивается из этой логики.",
    "Исход действительно относится к работе компании: официальные агенты Taobao (15,6% всех официальных агентов). После эксперимента ассистент развёрнут на всех агентов: «the assistant was launched to all agents on February 20, 2024». Это факт изменения работы, но известен он только со слов компании и авторов.",
    "Числа сверены: 5940 / 2895 (48,7%) / 3045 (51,3%), ~2,56 млн чатов, 0,39 млн оценок, 56,5%. −5,7% — эффект роста доли использования ИИ с 0 до 1, а не «средний эффект доступа». Квинтили по времени идентификации проблемы (ITT): Q1 −6,6%, Q5 −4,0% — верно. Рост retrial в Q5 +0,041 (p<0,05) — верно. Исход mixed обоснован.",
    "Мелкие неточности: дата первой подачи на arXiv (08.02.2026) не согласуется с идентификатором 2603.*, то есть март 2026."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/pdf/2603.29888",
     "publisher": "arXiv (препринт)",
     "published": "2026-07",
     "origin": "academic (данные компании Alibaba)",
     "quote_original": "The field experiment ended on February 19, 2024, and the assistant was launched to all agents on February 20, 2024.",
     "quote_ru": "Полевой эксперимент завершился 19 февраля 2024 года, а 20 февраля 2024 года ассистент был запущен для всех агентов."
    }
   ],
   "sources_opened": [
    "https://arxiv.org/pdf/2603.29888",
    "https://arxiv.org/abs/2603.29888"
   ]
  },
  {
   "entity_id": "CAND-4f974fca18e51840",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "Ключевая цифра («three times lower») имеет одно происхождение: слова EVP Walmart Дэниела Данкера в интервью Wired. Modern Retail (27.03.2026, Parton, Waldow), Forrester, The Tech Buzz, Search Engine Land и прочие только пересказывают эту цитату. Это самоотчёт компании, а не независимое измерение.",
    "Решение OpenAI от 24.03.2026 свернуть прямой Instant Checkout — факт о продукте OpenAI, а не подтверждение конверсии Walmart. OpenAI объясняет его общим поведением пользователей («researching products ... weren't using it to help them make purchases») и недостаточной гибкостью, Etsy сообщала о малом объёме. Этот шаг согласуется со словами Walmart, но не является независимым подтверждением исхода именно для Walmart. Главное изменение канала — решение OpenAI, а не перестройка работы Walmart.",
    "Автор ошибочно указал «конфликт» 33% ≠ 70%. По Forrester со ссылкой на The Tech Buzz, 70% относится к пилоту Sparky внутри ChatGPT, а не к Instant Checkout. Это разные каналы, противоречия нет. Кроме того, в metrics источником цифры «втрое ниже» указан Forrester, а это вторичный пересказ; в claims origin Modern Retail указан как company, хотя это независимая редакция, пересказывающая компанию.",
    "«В 3 раза ниже» — отношение конверсий, а не «≈33%»: это 1/3 от базовой конверсии, её абсолютное значение не раскрыто. Период и база не названы.",
    "Исход для конкретного канала (прямой чекаут внутри ChatGPT) — failure по критерию самой Walmart: конверсия хуже, канал заменён. Сохранение Walmart в ChatGPT через Sparky — другой процесс, он не делает этот исход mixed. Уровень C, в 120 не засчитывать."
   ],
   "added_evidence": [
    {
     "url": "https://www.modernretail.co/technology/what-went-wrong-with-chatgpts-instant-checkout/",
     "publisher": "Modern Retail",
     "published": "2026-03-27",
     "origin": "пересказ (интервью Walmart в Wired; блог OpenAI)",
     "quote_original": "The initial version of Instant Checkout did not offer the level of flexibility that we aspire to provide.",
     "quote_ru": "Первоначальная версия Instant Checkout не давала того уровня гибкости, к которому мы стремимся (OpenAI)."
    },
    {
     "url": "https://www.forrester.com/blogs/agentic-payments-in-b2c-commerce-where-we-are-now/",
     "publisher": "Forrester (со ссылкой на The Tech Buzz, 18.03.2026)",
     "published": "2026",
     "origin": "пересказ",
     "quote_original": "Walmart's pilot data for Sparky in ChatGPT showed users converting at roughly 70% of the rate of those using Walmart.com directly.",
     "quote_ru": "Пилотные данные Walmart по Sparky в ChatGPT показали конверсию примерно 70% от конверсии пользователей Walmart.com (другой канал, не Instant Checkout)."
    }
   ],
   "sources_opened": [
    "https://www.forrester.com/blogs/agentic-payments-in-b2c-commerce-where-we-are-now/",
    "https://www.modernretail.co/technology/what-went-wrong-with-chatgpts-instant-checkout/",
    "https://www.axios.com/2026/03/24/ai-shopping-walmart-gap-chatgpt-gemini-checkout (HTTP 403)",
    "https://searchengineland.com/walmart-chatgpt-checkout-converted-worse-472071 (HTTP 403)",
    "https://www.cnbc.com/2026/03/24/openai-revamps-shopping-experience-in-chatgpt-after-instant-checkout.html (HTTP 403)"
   ]
  },
  {
   "entity_id": "CAND-b1ed1053c262e420",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "The Register (21.07.2025, Simon Sharwood) опирается на посты Лемкина в X, LinkedIn и saastr.com. Ответ CEO Replit («Unacceptable and should never be possible», рефанд, постмортем, разделение dev/prod) подтверждён (The Register, 22.07.2025).",
    "Автор верно отметил: заявление агента о невозможности отката оказалось ложным («the rollback did work»). Уровень C и незачёт — верно: эксперимент одного пользователя и два заинтересованных источника."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.theregister.com/2025/07/21/replit_saastr_vibe_coding_incident/",
    "https://www.theregister.com/2025/07/22/replit_saastr_response/"
   ]
  },
  {
   "entity_id": "CAND-e5c6f06555b758bb",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "The Register (18.04.2025, Thomas Claburn): цитата Труэлла «We have no such policy...» и объяснение через race condition подтверждены. Дополнительно: Cursor начал маркировать ответы ИИ-поддержки, пострадавшему вернули деньги, баг исправлен.",
    "Число отмен подписок не установлено; статус UNKNOWN указан верно. Уровень C, failure для конкретной функции поддержки; незачёт верен."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.theregister.com/special-features/2025/04/18/cursor-ai-support-bot-hallucinated-its-own-company-policy/1015579"
   ]
  },
  {
   "entity_id": "CAND-5067c0e308573aeb",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "D",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Страница лога подтверждает: старт 10.06.2026, первая продажа $9 (23.08.2026), день 104 / run 1114 (22.09.2026) — всего $9, 8 визитов из answer engines. Владелец анонимен, подтверждений платежей нет.",
    "Уровень D и незачёт верны. Исход mixed допустим, но по экономической цели скорее failure; на зачёт это не влияет."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://aitoolsinsiderhq.com/log/"
   ]
  },
  {
   "entity_id": "CAND-7b39dfef7bc52c34",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "arXiv 2504.11436 (v1 15.04.2025, v4 13.11.2025; Dillon, Jaffe, Immorlica, Stanton): 66 организаций, 7137 участников, −2 ч/нед на email у пользователей, отсутствие сдвигов в объёме и составе задач — подтверждено.",
    "Методическое замечание: неизменность по встречам и документам — нулевой эффект, а не разнонаправленный. По протоколу это скорее ограниченный success (экономия времени на email) с нулевыми эффектами в остальном, а не mixed. На уровень C и незачёт это не влияет: аффилиация с Microsoft, данные вендора, независимого подтверждения нет."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/abs/2504.11436"
   ]
  },
  {
   "entity_id": "CAND-b6d0a90d8475645a",
   "checked": true,
   "verdict": "needs_rework",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Официальная страница INSEAD подтверждает: WP 2026/01/STR, 316 сотрудников, 42 команды, европейская технологическая сервисная компания. Рост центральности у группы с ИИ; специалисты больше выиграли в центральности знаний, универсалы — в производительности.",
    "Неверная классификация исхода: все измеренные эффекты по abstract положительные и отличаются только величиной по ролям. Разнонаправленности нет, поэтому это success (SOURCE_CLAIM по abstract), а не mixed. Уровень C и незачёт верны: полного текста нет, одно происхождение."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.insead.edu/faculty-research/publications/working-papers/impact-generative-ai-adoption-organizational-networks"
   ]
  }
 ],
 "unchecked_entity_ids": [],
 "packet_notes_ru": "Из трёх предложенных в 120 подтверждаю одну: Presto (понижена A→B, failure, засчитывается). Alibaba и Walmart переведены в C и не засчитываются. Системная ошибка автора: смешение «независимого автора или анализа» с «независимым происхождением данных». У Alibaba данные и эксперимент принадлежат компании, соавторов из Alibaba двое, а не один. У Walmart все пересказы восходят к одному интервью Данкера в Wired, а решение OpenAI — факт о продукте OpenAI. Правило уровня B применено непоследовательно: INSEAD с полностью независимыми авторами получил C, Alibaba — B. Второстепенные ошибки: ложный «конфликт» 33% ≠ 70% у Walmart (70% относится к Sparky); у Presto пропущен факт использования ИИ стороннего поставщика (2021–2022); INSEAD и MS Copilot размечены как mixed при однонаправленных или нулевых эффектах. Использовано WebSearch: 3."
}
