{
 "packet_id": "E4B-SEL-2",
 "executor": "claude-sonnet subagent",
 "finished_at": "2026-09-23T00:00:00Z",
 "status": "submitted",
 "entities": [
  {
   "entity_id": "CAND-209f4cdca294769b",
   "label_ru": "Woolworths Group — Поддержка/возвраты и планирование корзины через ассистента Olive",
   "evidence_level": "B",
   "level_basis_ru": "Лично открыт первичный релиз Woolworths Group (29.06.2026, апгрейд Olive на Gemini Enterprise) и независимый академический разбор инцидента (The Conversation, проф. Uri Gal, University of Sydney, Business Information Systems). Факт инцидента (февраль 2026) и факт релонча (июль 2026) подтверждены несколькими источниками разного происхождения (отраслевая пресса iTnews/Computer Weekly, академический анализ) — B. Количественных метрик эффекта на возвраты/планирование корзины ни в одном источнике нет.",
   "outcome": "mixed",
   "outcome_basis_ru": "Цель: агентный Olive на Gemini Enterprise помогает с возвратами и планированием корзины. В середине февраля 2026 бот выдумывал личные истории («злая мать») — негативный инцидент, подтверждённый множеством независимых изданий и академическим разбором. Компания убрала проблемные скрипты по итогам жалоб клиентов (это признаёт сама компания и независимый анализ). Несмотря на инцидент, релонч агентной версии для всех клиентов состоялся по плану в июле 2026 (подтверждено пресс-релизом компании и независимой отраслевой прессой), добавлены восемь «agentic judges»-проверяющих. Количественного исхода (эффективность работы с возвратами/корзиной, CSAT) не измерено ни в одном источнике — оценка «mixed»: было реальное качественное происшествие с последующим исправлением, но заявленная цель процесса (поддержка/корзина) не имеет измеренного результата.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [],
   "claims": [
    {
     "claim_ru": "В середине февраля 2026 чат-бот Olive после апгрейда на Google Cloud Gemini Enterprise выдумывал личные истории о «злой матери» в ответах клиентам.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://www.cxtoday.com/ai-automation-in-cx/woolworths-ai-chatbot-olive-incident/",
       "title": "Woolworths AI Chatbot's \"Mother\" Incident Highlights Safety Issues",
       "publisher": "CX Today",
       "published": "2026-02",
       "origin": "media_repeat",
       "quote_original": "It asked me for my date of birth, and when I gave it, it started rambling about how its mother was born in the same year",
       "quote_ru": "Он спросил мою дату рождения, а когда я её назвал, начал рассказывать, что его мать родилась в том же году"
      },
      {
       "url": "https://theconversation.com/woolworths-ai-agent-rambled-about-its-mother-its-a-sign-of-deeper-problems-with-the-tech-rollout-277072",
       "title": "Woolworths' AI agent rambled about its 'mother'. It's a sign of deeper problems with the tech rollout",
       "publisher": "The Conversation (автор — проф. Uri Gal, University of Sydney)",
       "published": "2026",
       "origin": "academic",
       "quote_original": "companies launched customer-facing AI without adequate oversight and were caught off-guard by the consequences",
       "quote_ru": "компании запустили клиентоориентированный ИИ без должного надзора и были застигнуты врасплох последствиями"
      }
     ]
    },
    {
     "claim_ru": "Woolworths убрала заготовленные «шутливые» скрипты Olive по итогам жалоб клиентов и с июля 2026 разворачивает агентную версию Olive (планирование меню, корзина, скидки) для всех клиентов через приложение, дополнив её восемью «agentic judges» для проверки ответов.",
     "status": "VERIFIED",
     "what_verified": "implementation_fact",
     "evidence": [
      {
       "url": "https://www.woolworthsgroup.com.au/au/en/our-newsroom/media-releases/latest-news/2026/woolworths-takes-the-hassle-out-of-the-weekly-shop-with-new-digi.html",
       "title": "Woolworths takes the hassle out of the weekly shop with new digital tools to help you save time and money",
       "publisher": "Woolworths Group (пресс-релиз компании)",
       "published": "2026-06-29",
       "origin": "company",
       "quote_original": "rolling out to all customers using the Woolworths app in pick up and delivery mode in July",
       "quote_ru": "развёртывается для всех клиентов, использующих приложение Woolworths в режиме самовывоза и доставки, в июле"
      },
      {
       "url": "https://www.itnews.com.au/news/woolworths-gives-agentic-powered-olive-chatbot-to-its-200000-staff-625339",
       "title": "Woolworths gives agentic-powered Olive chatbot to its 200,000 staff",
       "publisher": "iTnews (отраслевое ИТ-издание)",
       "published": "2026",
       "origin": "independent",
       "quote_original": "The agentic-powered Olive will be put in front of shoppers in July, after two months of testing by Woolworths' 200,000 staff.",
       "quote_ru": "Агентная Olive будет представлена покупателям в июле — после двух месяцев тестирования 200 000 сотрудников Woolworths."
      }
     ]
    }
   ],
   "arithmetic": [],
   "counter_evidence_ru": "Независимый академический анализ (The Conversation) указывает на две технические проблемы: устаревшие заготовленные сценарии и отсутствие у LLM связи с реальной базой цен в реальном времени (ошибки в ценах). Автор также отмечает, что заявление Woolworths о «в основном позитивных отзывах» не подкреплено данными, а сама компания одновременно находится под расследованием ACCC по вопросу вводящих в заблуждение цен, что подрывает доверие к самооценке.",
   "alternative_explanations_ru": "Возможно, инцидент — типовая проблема любого LLM-агента без домен-специфичных guardrails на старте, а не специфика именно Woolworths; релонч в июле состоялся по ранее запланированному графику независимо от февральского инцидента.",
   "human_role_ru": "Клиент по заявлению компании проверяет и утверждает корзину перед оформлением («технология остаётся помощником, а не решающим»); человеческий контроль сохранён как guardrail, независимо не проверен на практике.",
   "timeline_ru": "Январь 2026 — апгрейд Olive на Gemini Enterprise; середина февраля 2026 — жалобы клиентов о выдуманных историях; после жалоб — удаление проблемных скриптов; май–июнь 2026 — тестирование агентной версии 200 000 сотрудниками; 29.06.2026 — пресс-релиз о новых возможностях; июль 2026 — релонч для всех клиентов.",
   "limitations_ru": "Количественных метрик эффекта на возвраты/планирование корзины нет ни в одном источнике. Независимые источники подтверждают факт инцидента и факт релонча, но не измеряют исход самого процесса поддержки.",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень B, исход установлен как mixed (не unknown), роль ИИ в изменении процесса поддержки/планирования корзины документально установлена независимыми источниками.",
   "sources_opened": [
    "https://www.cxtoday.com/ai-automation-in-cx/woolworths-ai-chatbot-olive-incident/",
    "https://www.woolworthsgroup.com.au/au/en/our-newsroom/media-releases/latest-news/2026/woolworths-takes-the-hassle-out-of-the-weekly-shop-with-new-digi.html",
    "https://theconversation.com/woolworths-ai-agent-rambled-about-its-mother-its-a-sign-of-deeper-problems-with-the-tech-rollout-277072"
   ],
   "unreachable": []
  },
  {
   "entity_id": "CAND-38b1134a69f02c0a",
   "label_ru": "monday.com — Реорганизация штата и заявленная модель «люди + ИИ-агенты»",
   "evidence_level": "B",
   "level_basis_ru": "Лично открыта первичная регуляторная публикация — 6-K monday.com Ltd. от 22.07.2026 на SEC EDGAR (прозрачное измерение: ~20% штата, $45–55 млн чистых расходов, сроки — 2-е полугодие 2026). Факт сокращения и его увязка компанией с фокусом на «AI Work Platform» подтверждены независимой прессой другого происхождения (Calcalist/Ctech, TechCrunch — сводная статья по всей индустрии, не просто перепечатка). Но это подтверждает факт решения, а не измеренный эффект модели «люди + агенты».",
   "outcome": "unknown",
   "outcome_basis_ru": "Объявлено решение о сокращении ~20% штата (~620 человек) 22.07.2026 в рамках перехода к модели «AI Work Platform» и «людей вместе с ИИ-агентами в одном рабочем пространстве» (цитата сооснователей). План должен быть «в основном завершён» во 2-м полугодии 2026 — то есть на момент проверки (23.09.2026) ещё не закрыт. Ни SEC-фильтр, ни независимая пресса не приводят измеренного эффекта реорганизации (продуктивность, выручка на сотрудника, качество работы агентов) — только объявление и финансовую оценку затрат на само сокращение. Объявленное решение ≠ измеренный исход.",
   "primary_category": "process_restructuring",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Сокращение штата",
     "value": "~20",
     "unit": "% от текущего штата (~620 человек)",
     "period": "объявлено 22.07.2026",
     "baseline": null,
     "source_url": "https://www.sec.gov/Archives/edgar/data/1845338/000117891326003553/zk2635715.htm"
    },
    {
     "name_ru": "Ожидаемые чистые расходы на реструктуризацию",
     "value": "45–55",
     "unit": "млн долл. США",
     "period": "преимущественно 2-е полугодие 2026",
     "baseline": null,
     "source_url": "https://www.sec.gov/Archives/edgar/data/1845338/000117891326003553/zk2635715.htm"
    }
   ],
   "claims": [
    {
     "claim_ru": "monday.com Ltd. объявила 22.07.2026 план сокращения примерно 20% текущего штата в рамках стратегического фокуса на AI Work Platform.",
     "status": "VERIFIED",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://www.sec.gov/Archives/edgar/data/1845338/000117891326003553/zk2635715.htm",
       "title": "monday.com Ltd. — Form 6-K (Restructuring Plan)",
       "publisher": "U.S. Securities and Exchange Commission / monday.com Ltd.",
       "published": "2026-07-22",
       "origin": "regulator",
       "quote_original": "The Plan includes a reduction of approximately 20% of the Company's current workforce.",
       "quote_ru": "План включает сокращение примерно на 20% текущего штата компании."
      },
      {
       "url": "https://www.calcalistech.com/ctechnews/article/udx1nmbdq",
       "title": "Monday.com cuts 20% of workforce as it restructures for the AI era",
       "publisher": "Calcalist (Ctech)",
       "published": "2026-07",
       "origin": "independent",
       "quote_original": "Monday.com cuts 20% of workforce as it restructures for the AI era",
       "quote_ru": "Monday.com сокращает 20% штата в рамках реструктуризации под эру ИИ"
      }
      ]
    },
    {
     "claim_ru": "Ожидаемые чистые расходы на план — $45–55 млн (из них $30–35 млн — выходные пособия, $30–35 млн — обесценение офисных площадей, за вычетом ~$15 млн неденежных кредитов по опционам).",
     "status": "VERIFIED",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://www.sec.gov/Archives/edgar/data/1845338/000117891326003553/zk2635715.htm",
       "title": "monday.com Ltd. — Form 6-K (Restructuring Plan)",
       "publisher": "U.S. Securities and Exchange Commission / monday.com Ltd.",
       "published": "2026-07-22",
       "origin": "regulator",
       "quote_original": "The Company estimates that it will incur approximately $45 - $55 million in net charges, consisting of approximately $30 - $35 million of future net charges related to severance payments, employee benefits, and related costs and approximately $30 - $35 million in charges related to the impairment of certain office space, partially offset by approximately $15 million in non-cash credits for share-based compensation.",
       "quote_ru": "Компания оценивает чистые расходы примерно в $45–55 млн, включая $30–35 млн будущих расходов на выходные пособия и льготы и $30–35 млн на обесценение офисных площадей, частично компенсированных примерно $15 млн неденежных кредитов по программам вознаграждения акциями."
      }
     ]
    },
    {
     "claim_ru": "Сокращение штата само по себе является измеренным эффектом внедрения ИИ-агентов на продуктивность или качество работы monday.com.",
     "status": "UNKNOWN",
     "what_verified": "none",
     "evidence": []
    }
   ],
   "arithmetic": [
    {
     "expr": "620 / ~3000 ≈ 20%",
     "result": "≈20.7%, согласуется с заявленными «примерно 20%»",
     "matches_source": true
    }
   ],
   "counter_evidence_ru": "Акции компании упали более чем на 50% с начала 2026 года, рыночная капитализация снизилась с $6,8 млрд (IPO 2021) до $3,1 млрд — по одной из версий (Yahoo Finance), это давление рынка могло быть не менее значимым мотивом сокращения, чем сама AI-стратегия; сооснователи публично заявили: «это решение принято не для сокращения издержек и не для замены людей ИИ» — то есть даже сама компания не позиционирует сокращение как прямой эффект внедрения агентов.",
   "alternative_explanations_ru": "Сокращение штата может объясняться общим замедлением роста SaaS-сектора и падением акций, а не конкретно эффективностью ИИ-агентов; риторика «люди + агенты» может быть частью репозиционирования для инвесторов на фоне давления рынка.",
   "human_role_ru": "Заявленная модель предполагает совместную работу людей и ИИ-агентов «в одном рабочем пространстве»; конкретных данных о распределении задач между людьми и агентами не раскрыто.",
   "timeline_ru": "22.07.2026 — объявление плана реструктуризации и сокращения ~20% штата (~620 человек, из них ~350 в Тель-Авиве); Q2 2026 — уже признаны расходы $21,4 млн (обесценение офисных активов в Израиле); план должен быть в основном завершён во 2-м полугодии 2026.",
   "limitations_ru": "Ни один источник не измеряет эффект от внедрения ИИ-агентов на производительность или результаты компании; связь сокращения именно с ролью ИИ-агентов заявлена компанией, но не проверена независимо.",
   "counted_in_120_proposed": false,
   "reason_ru": "Исход не установлен (unknown) — объявленное решение о реструктуризации не равно измеренному результату модели «люди + ИИ-агенты»; правило 6 требует установленного исхода.",
   "sources_opened": [
    "https://www.timesofisrael.com/israels-monday-com-lays-off-20-of-its-employees-as-ai-changes-how-work-gets-done/",
    "https://www.sec.gov/Archives/edgar/data/0001845338/000117891326003971/exhibit_99-1.htm",
    "https://www.sec.gov/Archives/edgar/data/0001845338/000117891326003971/zk2635817.htm",
    "https://www.sec.gov/Archives/edgar/data/1845338/000117891326003553/zk2635715.htm"
   ],
   "unreachable": [
    "https://www.stocktitan.net/sec-filings/MNDY/6-k-monday-com-ltd-current-report-foreign-issuer-766551d8723d.html"
   ]
  },
  {
   "entity_id": "CAND-3deb69b113ee0870",
   "label_ru": "NHS England — Административная работа сотрудников NHS (документы, письма, отчётность) с Microsoft 365 Copilot",
   "evidence_level": "C",
   "level_basis_ru": "Лично открыт первичный релиз вендора (Microsoft, 08.06.2026) — это самоотчёт поставщика/заказчика, метод расчёта 43 минут не раскрыт. Официальная страница NHS England (england.nhs.uk) оказалась недоступна для извлечения содержимого при двух попытках — помечена unreachable. Независимая клиническая колонка (iatroX, автор — врач общей практики Dr Kola Tytler) прямо характеризует цифру 43 минуты как «trial-reported productivity figure from the parties rolling out the product» — то есть подтверждает, что это самоотчёт сторон, внедряющих продукт, а не независимое измерение. Независимого источника с собственным измерением эффекта нет — уровень C.",
   "outcome": "unknown",
   "outcome_basis_ru": "Цель (по заявлению вендора): сокращение административной нагрузки на 43 минуты в день на сотрудника в пилоте на 30 000+ сотрудниках 90 организаций NHS, с последующим ролаутом на 505 000 clinicians and support staff. Метод измерения не раскрыт ни в одном открытом источнике; независимая клиническая экспертиза (iatroX, 11.07.2026) прямо указывает, что «productivity self-reports are notoriously generous compared with measured output» и что «43 reclaimed minutes... does not automatically convert into appointments, procedures or shorter waits» — то есть даже перевод сэкономленных минут в клинический эффект не установлен. Результаты пилота, как сообщается, планируется опубликовать в BMJ Health & Care Informatics «позже в этом году» — на дату проверки не опубликованы. Клинический эффект не заявлен и не измерен.",
   "primary_category": "process_restructuring",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Заявленная экономия времени на сотрудника",
     "value": "43",
     "unit": "минут в день (≈5 недель в год)",
     "period": "пилот, дата объявления 08.06.2026",
     "baseline": null,
     "source_url": "https://news.microsoft.com/source/2026/06/08/nhs-england-accelerates-ai-adoption-with-microsoft-365-copilot-to-improve-service-delivery-reduce-costs-and-create-more-time-for-care/"
    }
   ],
   "claims": [
    {
     "claim_ru": "Пилот на 30 000+ сотрудниках 90 организаций NHS показал в среднем 43 минуты экономии административного времени в день на сотрудника; запланирован ролаут на 505 000 clinicians and support staff.",
     "status": "SOURCE_CLAIM",
     "what_verified": "publication",
     "evidence": [
      {
       "url": "https://news.microsoft.com/source/2026/06/08/nhs-england-accelerates-ai-adoption-with-microsoft-365-copilot-to-improve-service-delivery-reduce-costs-and-create-more-time-for-care/",
       "title": "NHS England accelerates AI adoption with Microsoft 365 Copilot to improve service delivery, reduce costs and create more time for care",
       "publisher": "Microsoft News Source (пресс-релиз вендора)",
       "published": "2026-06-08",
       "origin": "company",
       "quote_original": "save on average 43 minutes per staff member per day",
       "quote_ru": "экономить в среднем 43 минуты на сотрудника в день"
      }
     ]
    },
    {
     "claim_ru": "Цифра 43 минуты — самоотчёт сторон, внедряющих продукт, требующий осторожной интерпретации; перевод в клинический эффект не доказан.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://www.iatrox.com/blog/microsoft-365-copilot-nhs-505000-staff-what-it-is-not",
       "title": "Microsoft 365 Copilot for 505,000 NHS Staff: What It Is, and What It Is Not",
       "publisher": "iatroX (независимая медицинская колонка, автор Dr Kola Tytler MBBS)",
       "published": "2026-07-11",
       "origin": "independent",
       "quote_original": "it is a trial-reported productivity figure from the parties rolling out the product",
       "quote_ru": "это показатель продуктивности, сообщённый в рамках пилота сторонами, которые внедряют продукт"
      }
     ]
    }
   ],
   "arithmetic": [
    {
     "expr": "43 мин/день × 5 дней × 52 нед / 60 мин = 186 ч/год ≈ 4,65 нед. по 40-час. неделе",
     "result": "≈4,6–5 недель в год — согласуется с заявленными «пятью неделями»",
     "matches_source": true
    }
   ],
   "counter_evidence_ru": "Независимая клиническая колонка iatroX указывает на риски: сотрудники вставляли идентифицируемые данные пациентов целиком в Copilot для получения сводки (по сообщению информатора в рамках пилота) — потенциальное нарушение конфиденциальности; пациентские группы выражают опасения по поводу ошибок ИИ в медицинских записях. Масштабирование результата с 90 организаций на 505 000 сотрудников не гарантировано: «If the 43-minute admin saving fails to replicate at 505,000-user scale, NHS trusts face sunk license costs and clinician backlash».",
   "alternative_explanations_ru": "Возможно, часть заявленной экономии отражает субъективное восприятие удобства инструмента, а не фактическое сокращение рабочего времени; самоотчётные оценки продуктивности систематически завышены по сравнению с измеряемым результатом (отмечено независимым источником).",
   "human_role_ru": "Инструмент используется сотрудниками NHS как ассистент для документов, писем, отчётности; решения и клиническая ответственность остаются за людьми.",
   "timeline_ru": "Пилот на 30 000+ сотрудниках 90 организаций; 07–08.06.2026 — объявление о переходе к ролауту на 505 000 сотрудников (цель — 200 000 пользователей за первые 6 месяцев, полное развёртывание к октябрю 2026 по независимым источникам); 11.07.2026 — независимая клиническая колонка с критикой методологии; результаты пилота ожидаются в публикации BMJ Health & Care Informatics «позже в этом году» (не опубликовано на дату проверки).",
   "limitations_ru": "Официальная страница NHS England (england.nhs.uk) с тем же объявлением дважды не отдавала содержимое при попытке открыть — помечена unreachable, поэтому независимая от вендора правительственная версия текста лично не проверена. Метод измерения 43 минут нигде не раскрыт открыто.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C (самоотчёт вендора/заказчика, независимо не измерено), исход unknown — оба условия правила 6 не выполнены.",
   "sources_opened": [
    "https://news.microsoft.com/source/2026/06/08/nhs-england-accelerates-ai-adoption-with-microsoft-365-copilot-to-improve-service-delivery-reduce-costs-and-create-more-time-for-care/",
    "https://www.iatrox.com/blog/microsoft-365-copilot-nhs-505000-staff-what-it-is-not"
   ],
   "unreachable": [
    "https://www.england.nhs.uk/2026/06/500000-nhs-staff-to-get-new-artificial-intelligence-tools-to-help-free-up-more-time-for-patients/"
   ]
  },
  {
   "entity_id": "CAND-9ab6a08bfe985926",
   "label_ru": "Ocado (онлайн-ритейл) — Ответы на запросы клиентов на сайте",
   "evidence_level": "C",
   "level_basis_ru": "Лично открыт первичный источник The Grocer (ранее считавшийся недоступным — в этой проверке открылся) и независимая отраслевая публикация Diginomica с деталями внедрения (Salesforce Service Cloud agent assist, Google CCAI, Sierra). Оба источника — независимая отраслевая пресса, но оба лишь описывают факт внедрения/пилота со слов сотрудников Ocado (интервью), без независимого измерения эффекта — уровень C.",
   "outcome": "unknown",
   "outcome_basis_ru": "Цель (заявленная): агентный чат-бот на сайте обрабатывает рутинные запросы клиентов, высвобождая людей для сложных случаев. По The Grocer (интервью с e-commerce-директором Siobhan Bowie), на момент публикации функция доступна ~10% пользователей в рамках пилота, «rollout further in the coming weeks». По Diginomica (позднее, детали про Salesforce Agentforce, Google CCAI, чат-бот Sierra/Herbie), проект описан как «early deployment phase», без метрик. Ни один источник не приводит измеримого результата (доля автоматизации, CSAT, стоимость обращения). Одиночный клиентский отзыв на Trustpilot (сентябрь 2026) с критикой систем поддержки Ocado найден через поиск, но при собственном открытии страницы Trustpilot конкретная цитата с критикой ИИ-бота не подтвердилась — не включена в свидетельства.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Доля пользователей с доступом к агентному чат-боту (трайл)",
     "value": "10",
     "unit": "% пользователей Ocado",
     "period": "февраль 2026, трайл",
     "baseline": null,
     "source_url": "https://www.thegrocer.co.uk/news/ocado-to-ramp-up-use-of-game-changing-ai-to-improve-shopper-experience/715759.article"
    }
   ],
   "claims": [
    {
     "claim_ru": "Ocado запустила агентный ИИ-чат-бот для обработки запросов клиентов на сайте, доступный на момент публикации ~10% пользователей в рамках трайла.",
     "status": "VERIFIED",
     "what_verified": "implementation_fact",
     "evidence": [
      {
       "url": "https://www.thegrocer.co.uk/news/ocado-to-ramp-up-use-of-game-changing-ai-to-improve-shopper-experience/715759.article",
       "title": "Ocado to ramp up use of 'game-changing' AI to improve shopper experience",
       "publisher": "The Grocer",
       "published": "2026-02-26",
       "origin": "independent",
       "quote_original": "So far, the feature is only available to around 10% of Ocado users as part of a trial",
       "quote_ru": "Пока функция доступна лишь примерно 10% пользователей Ocado в рамках трайла"
      }
     ]
    },
    {
     "claim_ru": "Ocado внедряет агентную поддержку через Salesforce Service Cloud (agent assist) с привлечением выездных инженеров Salesforce, консолидируя ранее разрозненные каналы (email в Salesforce, live chat через Google CCAI, чат-бот на платформе Sierra) под Salesforce Agentforce.",
     "status": "VERIFIED",
     "what_verified": "implementation_fact",
     "evidence": [
      {
       "url": "https://diginomica.com/ocado-retail-shops-around-greenfield-tech-stack-it-looks-agentic-ai-deliver",
       "title": "Ocado Retail shops around for greenfield tech stack as it looks to agentic AI to deliver",
       "publisher": "Diginomica",
       "published": "2026",
       "origin": "independent",
       "quote_original": "email is done natively within Salesforce, live chat is done through Google CCAI's products, and we have a chatbot that runs in Sierra",
       "quote_ru": "почта обрабатывается нативно в Salesforce, живой чат — через продукты Google CCAI, а чат-бот работает на платформе Sierra"
      }
     ]
    }
   ],
   "arithmetic": [],
   "counter_evidence_ru": "Diginomica приводит слова руководителя ИТ Ocado Kieren Johnson о введённых защитных механизмах против чрезмерных затрат на нерелевантные запросы и галлюцинаций, при этом он признаёт: «haven't yet seen it hallucinate» — то есть отсутствие проблем пока не проверено на длительном горизонте, это самонаблюдение сотрудника компании.",
   "alternative_explanations_ru": "Рост Ocado и её положение самой быстрорастущей сети Великобритании в источниках связываются с общим апгрейдом технологической платформы (пятилетний проект, завершён в июле), а не конкретно с чат-ботом поддержки.",
   "human_role_ru": "По заявлению Ocado, агентная поддержка предназначена высвобождать человеческую команду поддержки для более сложных случаев, требующих участия человека; конкретное распределение нагрузки между ботом и людьми не раскрыто.",
   "timeline_ru": "26.02.2026 — публикация The Grocer о трайле на 10% пользователей; далее (дата статьи Diginomica не установлена точно, но позднее 2026) — детали архитектуры на Salesforce/Google CCAI/Sierra, переход к консолидации под Agentforce, «early deployment phase».",
   "limitations_ru": "Метрик эффективности (стоимость обращения, CSAT, доля автоматизации) не найдено ни в одном лично открытом источнике. Заявленная в input.json цитата о недоступности The Grocer более не актуальна — источник открылся в этой проверке.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C, исход не установлен (unknown) — оба условия правила 6 не выполнены.",
   "sources_opened": [
    "https://www.thegrocer.co.uk/news/ocado-to-ramp-up-use-of-game-changing-ai-to-improve-shopper-experience/715759.article",
    "https://diginomica.com/ocado-retail-shops-around-greenfield-tech-stack-it-looks-agentic-ai-deliver",
    "https://www.trustpilot.com/review/www.ocado.com"
   ],
   "unreachable": []
  },
  {
   "entity_id": "CAND-fc50e04df6fa00f8",
   "label_ru": "Ingka Group (IKEA) — Клиентский сервис: чат-бот Billie и переобучение операторов контакт-центра в удалённых консультантов по интерьеру",
   "evidence_level": "B",
   "level_basis_ru": "Лично открыт первичный документ компании — новостной материал Ingka Group newsroom от 29.06.2023 с прозрачными цифрами (47% запросов за FY21–FY23, €1,3 млрд за FY22 = 3,3% выручки, цель 10% к 2028). Ключевой качественный исход («операторов переобучили, а не уволили, и это решение не было отменено в ходе сокращений 2026 года») независимо подтверждён двумя источниками другого происхождения: Fortune (собственная журналистская работа, 30.07.2026) и employerbranding.news (независимый разбор после сокращений 2026 года, тоже 2026). Финансовые/CSAT-цифры при этом остаются данными компании, повторяемыми прессой без собственного измерения — для них уровень остаётся C.",
   "outcome": "mixed",
   "outcome_basis_ru": "Цель (компании): не увольнять операторов контакт-центра при внедрении чат-бота Billie, а переобучить их в консультантов по удалённому дизайну интерьера, нарастив канал удалённых продаж. По данным Ingka Group (первичный документ, FY22, т.е. 01.09.2021–31.08.2022): 8 500 переобученных сотрудников, выручка удалённого канала €1,3 млрд = 3,3% от общей выручки (сходится с независимо пересчитанным total ≈ €39,4–39,6 млрд, см. арифметику), цель — 10% к 2028. По более поздним данным (Fortune, 30.07.2026, «last fiscal year» и «prior year»): €1,25 млрд против €1,08 млрд годом ранее (рост ≈15,7%, что согласуется с заявленным диапазоном 15–20%), доля Billie в решении запросов выросла до 74% (с 47% в 2021–2023). Независимая журналистская проверка (employerbranding.news, 2026) подтверждает: сокращения Ingka (март 2026, ~800 должностей) и Inter IKEA (май 2026, ~850 должностей) — офисные/корпоративные роли, явно не связанные компанией с ИИ (названы макроэкономические причины), и НЕ затронули 8 500 переобученных консультантов. Итог смешанный: качественная цель (сохранение занятости через переобучение) независимо подтверждена как выполненная и устойчивая к 2026 году; количественные финансовые и CSAT-показатели остаются самоотчётом компании, независимо не аудированы.",
   "primary_category": "process_restructuring",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Доля запросов, решаемых Billie",
     "value": "47",
     "unit": "%",
     "period": "FY21–FY23 (с 2021 по 2023)",
     "baseline": null,
     "source_url": "https://www.ingka.com/newsroom/ai-and-remote-selling-bring-ikea-design-expertise-to-the-many/"
    },
    {
     "name_ru": "Доля запросов, решаемых Billie (позднее значение)",
     "value": "74",
     "unit": "%",
     "period": "к июлю 2026 (по данным Fortune)",
     "baseline": "47% в 2021–2023",
     "source_url": "https://fortune.com/2026/07/30/ikea-ai-workforce-reskilling-jobs-billie-chatbot-global-500/"
    },
    {
     "name_ru": "Выручка удалённого канала продаж (интерьерные консультанты)",
     "value": "1,3",
     "unit": "млрд евро (3,3% от общей выручки Ingka)",
     "period": "FY22 (01.09.2021–31.08.2022)",
     "baseline": null,
     "source_url": "https://www.ingka.com/newsroom/ai-and-remote-selling-bring-ikea-design-expertise-to-the-many/"
    },
    {
     "name_ru": "Выручка удалённого канала продаж (позднее значение)",
     "value": "1,25",
     "unit": "млрд евро",
     "period": "«последний финансовый год» на 30.07.2026 (точный период не назван)",
     "baseline": "1,08 млрд евро годом ранее",
     "source_url": "https://fortune.com/2026/07/30/ikea-ai-workforce-reskilling-jobs-billie-chatbot-global-500/"
    },
    {
     "name_ru": "Число переобученных операторов",
     "value": "8500",
     "unit": "человек",
     "period": "с 2021 г., сохраняется на 2026 г.",
     "baseline": null,
     "source_url": "https://www.ingka.com/newsroom/ai-and-remote-selling-bring-ikea-design-expertise-to-the-many/"
    }
   ],
   "claims": [
    {
     "claim_ru": "Чат-бот Billie решил около 47% из 3,2 млн обращений за 2021–2023 гг.; удалённый канал продаж принёс €1,3 млрд (3,3% выручки Ingka) в FY22, с целью роста доли до 10% к 2028 г.",
     "status": "VERIFIED",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://www.ingka.com/newsroom/ai-and-remote-selling-bring-ikea-design-expertise-to-the-many/",
       "title": "AI and Remote Selling bring IKEA design expertise to the many",
       "publisher": "Ingka Group (первичный источник компании)",
       "published": "2023-06-29",
       "origin": "company",
       "quote_original": "Sales through Ingka Group's remote customer meeting points reached EUR 1.3 billion at the end of FY22, accounting for 3.3% of total sales",
       "quote_ru": "Продажи через удалённые каналы обслуживания клиентов Ingka Group достигли 1,3 млрд евро на конец FY22, что составляет 3,3% от общих продаж"
      }
     ]
    },
    {
     "claim_ru": "Сокращения в Ingka (март 2026, ~800 должностей) и Inter IKEA (май 2026, ~850 должностей) — корпоративные/офисные роли, официально не связанные компаниями с ИИ, и не затронули 8 500 переобученных консультантов по интерьеру.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://employerbranding.news/resources/what-ikeas-ai-reskilling-story-looks-like-now-it-has-made-layoffs-too/",
       "title": "IKEA's AI Reskilling Case, Reassessed After 2026 Layoffs",
       "publisher": "employerbranding.news (независимый разбор)",
       "published": "2026",
       "origin": "independent",
       "quote_original": "the simpler, cleaner version of the IKEA case, automate, redeploy, never cut, does not survive 2026",
       "quote_ru": "упрощённая, «чистая» версия кейса IKEA — «автоматизируй, переобучи, никогда не сокращай» — не выдерживает проверки 2026 годом"
      },
      {
       "url": "https://fortune.com/2026/07/30/ikea-ai-workforce-reskilling-jobs-billie-chatbot-global-500/",
       "title": "Inside Ikea's big bet on humans in the age of AI",
       "publisher": "Fortune",
       "published": "2026-07-30",
       "origin": "independent",
       "quote_original": "One big question that hangs over Ikea's experiment is whether Billie will come for these workers' new roles.",
       "quote_ru": "Главный вопрос, нависающий над экспериментом IKEA: не заберёт ли Billie и эти новые роли работников."
      }
     ]
    }
   ],
   "arithmetic": [
    {
     "expr": "1,3 млрд € / 3,3% = ~39,4 млрд € — сверка с независимо названной долей онлайн-продаж (9,9 млрд € = 25% выручки → 39,6 млрд €)",
     "result": "39,4 млрд € и 39,6 млрд € — близкие оценки общей выручки Ingka, расхождение в пределах округления, противоречия нет",
     "matches_source": true
    },
    {
     "expr": "(1,25 − 1,08) / 1,08 × 100%",
     "result": "≈15,7% роста, что согласуется с заявленным диапазоном «15–20% в год»",
     "matches_source": true
    }
   ],
   "counter_evidence_ru": "Fortune (независимая журналистика, но интервью с компанией) прямо указывает на риск: сам чат-бот Billie может со временем взять на себя и новые консультационные роли, обесценив «постоянство» переобучения. employerbranding.news подчёркивает, что успешный нарратив «никого не увольняем» защищает не всех сотрудников одинаково — сокращения 2026 года затронули именно офисный/корпоративный персонал, что требует уточнения формулировки исхода, а не безусловного «success».",
   "alternative_explanations_ru": "Рост удалённого канала продаж мог быть обусловлен общим ростом онлайн-торговли IKEA (25% продаж онлайн, FY22) и постпандемийными трендами, а не исключительно эффектом Billie/переобучения; часть роста CSAT (60%→89%, не подтверждено лично открытым источником) может отражать общие улучшения сервиса.",
   "human_role_ru": "8 500 операторов колл-центра переобучены в консультантов по удалённому дизайну интерьера — люди остаются в процессе, Billie обрабатывает рутинные запросы, высвобождая людей для более сложных консультационных задач.",
   "timeline_ru": "2021 — запуск Billie; FY21–FY23 — рост доли решаемых ботом запросов до 47%; 29.06.2023 — первичная публикация Ingka Group с цифрами FY22; март 2026 — сокращение ~800 офисных должностей Ingka; май 2026 — сокращение ~850 должностей Inter IKEA; 30.07.2026 — независимый разбор Fortune с обновлёнными цифрами (74%, €1,25 млрд); 2026 — независимый критический разбор employerbranding.news после сокращений.",
   "limitations_ru": "Цифры CSAT (60%→89%) не подтверждены ни в одном лично открытом источнике (ни Ingka newsroom, ни CIO.com, ни Fortune её не привели) — исключены из проверенных метрик. Финансовые и CSAT-показатели остаются самоотчётом компании; независимые источники подтверждают лишь организационный факт (сохранение ролей), не аудируют цифры.",
   "counted_in_120_proposed": true,
   "reason_ru": "Уровень B (первичный документ компании + независимое подтверждение ключевого организационного исхода из двух источников другого происхождения), исход установлен как mixed, роль ИИ (Billie) в изменении процесса контакт-центра документально установлена.",
   "sources_opened": [
    "https://www.cxtoday.com/contact-center/ikeas-contact-center-agents-become-interior-design-advisors/",
    "https://www.ingka.com/newsroom/ai-and-remote-selling-bring-ikea-design-expertise-to-the-many/",
    "https://www.cio.com/article/4180896/how-ikea-turned-a-chatbot-with-13-million-users-into-a-business-worth-1-3-million.html",
    "https://fortune.com/2026/07/30/ikea-ai-workforce-reskilling-jobs-billie-chatbot-global-500/",
    "https://employerbranding.news/resources/what-ikeas-ai-reskilling-story-looks-like-now-it-has-made-layoffs-too/"
   ],
   "unreachable": []
  },
  {
   "entity_id": "CAND-1705afb6d0fea85a",
   "label_ru": "California State University (22 кампуса), OpenAI — Доступ студентов и сотрудников университетской системы к ChatGPT Edu",
   "evidence_level": "C",
   "level_basis_ru": "Лично открыт первичный журналистский материал CalMatters (независимая некоммерческая редакция) с цифрами из внутреннего опроса CSU (94 000+ респондентов) — но сам опрос является самоотчётом CSU, а не независимым измерением. Независимое подтверждение факта продления контракта получено из другого источника (Local News Matters, другое происхождение) — но продление подтверждает лишь факт контракта, не образовательный эффект. Ни один источник не приводит независимого измерения учебных результатов — уровень C.",
   "outcome": "mixed",
   "outcome_basis_ru": "Цель (по CSU): доступ к ChatGPT Edu 500 000 студентов и 60 000 сотрудников улучшает опыт обучения. Внутренний опрос CSU (94 000+ респондентов, самоотчёт) показал 64% положительной оценки влияния ИИ на обучение — но при этом 52% преподавателей сообщили о негативном эффекте на преподавание, 67% студентов считают, что преподаватели не учат эффективному использованию ИИ, 78% отметили этические опасения как значимую проблему; добровольное обучение работе с ИИ на апрель прошли лишь 0,7% студентов и 16% сотрудников. Контракт стоимостью $17 млн (18 мес., до июля 2026) был продлён на 3 года за $13 млн/год (подтверждено независимо, Local News Matters, без предъявления новых данных об учебном эффекте). Разнонаправленные самоотчётные показатели (64% позитив vs 52%/67%/78% негативных сигналов) без независимого измерения итогов обучения → mixed.",
   "primary_category": "adjacent_automation",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Положительная оценка влияния ИИ на обучение",
     "value": "64",
     "unit": "% опрошенных (94 000+ студентов, преподавателей и сотрудников)",
     "period": "опрос, упомянут в материале от мая 2026",
     "baseline": null,
     "source_url": "https://calmatters.org/education/2026/05/california-state-university-open-ai-chatgpt-contract/"
    },
    {
     "name_ru": "Завершили добровольное обучение работе с ИИ (студенты)",
     "value": "0,7",
     "unit": "%",
     "period": "по состоянию на апрель",
     "baseline": null,
     "source_url": "https://calmatters.org/education/2026/05/california-state-university-open-ai-chatgpt-contract/"
    },
    {
     "name_ru": "Завершили добровольное обучение работе с ИИ (преподаватели)",
     "value": "16",
     "unit": "%",
     "period": "по состоянию на апрель",
     "baseline": null,
     "source_url": "https://calmatters.org/education/2026/05/california-state-university-open-ai-chatgpt-contract/"
    },
    {
     "name_ru": "Стоимость первого контракта",
     "value": "17",
     "unit": "млн долл. США за 18 месяцев",
     "period": "январь 2025 – июль 2026",
     "baseline": null,
     "source_url": "https://calmatters.org/education/2026/05/california-state-university-open-ai-chatgpt-contract/"
    },
    {
     "name_ru": "Стоимость продлённого контракта",
     "value": "13",
     "unit": "млн долл. США в год на 3 года",
     "period": "с 2026 г.",
     "baseline": "17 млн за 18 мес. (~11,3 млн/год) в первом контракте",
     "source_url": "https://localnewsmatters.org/2026/05/27/csu-renews-openai-chatgpt-contract/"
    }
   ],
   "claims": [
    {
     "claim_ru": "64% студентов, преподавателей и сотрудников CSU сообщили о положительном влиянии ИИ на опыт обучения; при этом 52% преподавателей отметили негативный эффект на преподавание, 67% студентов считают обучение использованию ИИ недостаточным, 78% выразили этическую озабоченность; добровольное обучение к апрелю прошли 0,7% студентов и 16% сотрудников.",
     "status": "SOURCE_CLAIM",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://calmatters.org/education/2026/05/california-state-university-open-ai-chatgpt-contract/",
       "title": "Cal State struck a deal with OpenAI. Some students and faculty refuse to use it",
       "publisher": "CalMatters (независимая некоммерческая редакция)",
       "published": "2026-05",
       "origin": "independent",
       "quote_original": "64% of students, faculty and staff reported AI affected their learning experience positively",
       "quote_ru": "64% студентов, преподавателей и сотрудников сообщили, что ИИ положительно повлиял на их опыт обучения"
      }
     ]
    },
    {
     "claim_ru": "Контракт CSU с OpenAI продлён на 3 года за $13 млн/год без предъявления новых данных об эффективности; сумма первого контракта ($17 млн за 18 мес.) вызывает критику на фоне бюджетного дефицита CSU.",
     "status": "VERIFIED",
     "what_verified": "implementation_fact",
     "evidence": [
      {
       "url": "https://localnewsmatters.org/2026/05/27/csu-renews-openai-chatgpt-contract/",
       "title": "CSU renews controversial OpenAI deal despite faculty criticism, budget cuts",
       "publisher": "Local News Matters (независимая некоммерческая редакция)",
       "published": "2026-05-27",
       "origin": "independent",
       "quote_original": "California State University officials have renewed their controversial contract with OpenAI — developer of ChatGPT — reigniting a fight over institutional priorities.",
       "quote_ru": "Руководство Калифорнийского государственного университета продлило спорный контракт с OpenAI, разработчиком ChatGPT, вновь разжигая спор о приоритетах учреждения."
      }
     ]
    }
   ],
   "arithmetic": [
    {
     "expr": "17 млн / 18 мес. = 0,944 млн/мес ≈ 11,3 млн/год (сравнение с продлённым тарифом 13 млн/год)",
     "result": "Продлённый контракт дороже в годовом выражении (13 млн/год против ≈11,3 млн/год в первом контракте) — рост примерно на 15%",
     "matches_source": true
    }
   ],
   "counter_evidence_ru": "Независимая пресса (Local News Matters, EdSource — последний недоступен для прямого открытия, 403) описывает продление контракта как спорное решение на фоне бюджетного дефицита CSU в $144 млн, критикуемое как чрезмерно дорогое (\"nearly $1 million a month\"); значительная часть преподавателей и студентов, по данным собственного опроса CSU, отмечает негативные и этические эффекты, а не только позитивные.",
   "alternative_explanations_ru": "Крайне низкий процент прошедших добровольное обучение (0,7% студентов) может означать, что положительная оценка 64% отражает общее отношение к доступности инструмента, а не результат осознанного, обученного использования; корреляция между использованием ChatGPT Edu и учебными результатами не измерялась.",
   "human_role_ru": "Студенты и сотрудники используют ChatGPT Edu добровольно как сквозной инструмент; формальное обучение работе с ИИ пройдено ничтожной долей пользователей.",
   "timeline_ru": "Январь 2025 — подписан контракт CSU–OpenAI; февраль 2025 — объявление; май 2026 — публикация CalMatters с данными опроса; 27.05.2026 — подтверждение продления контракта (Local News Matters); контракт должен был истечь в июле 2026, продлён на 3 года за $13 млн/год.",
   "limitations_ru": "Методология внутреннего опроса CSU (94 000+ респондентов) не раскрыта в открытых источниках; независимого измерения учебных результатов (оценки, успеваемость) не найдено. Материал EdSource о продлении контракта недоступен (403 Forbidden) — не может быть процитирован.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C (самоотчётный опрос CSU, независимо не измеренный образовательный эффект) — правило 6 требует A/B.",
   "sources_opened": [
    "https://calmatters.org/education/2026/05/california-state-university-open-ai-chatgpt-contract/",
    "https://localnewsmatters.org/2026/05/27/csu-renews-openai-chatgpt-contract/"
   ],
   "unreachable": [
    "https://edsource.org/2026/cal-state-renews-controversial-system-wide-contract-with-openai/758919"
   ]
  },
  {
   "entity_id": "CAND-ce61fc960efd6773",
   "label_ru": "Goldman Sachs — Пилот автономного кодирующего агента Devin в инженерной организации банка (гибридная рабочая сила)",
   "evidence_level": "C",
   "level_basis_ru": "Лично открыт первичный источник TechCrunch (11.07.2025, пересказ заявлений CIO Marco Argenti на стадии пилота, без метрик). Заявленные в поиске метрики «4x быстрее», «67% против 34% смерженных PR», «2x эффективность» лично проверены на источнике — это собственный годовой обзор вендора Cognition (не Goldman, не независимый источник), причём Goldman в нём лишь упомянут в списке клиентов без привязки цифр конкретно к банку. Независимая техническая проверка (The Register, январь 2025) по общей (не Goldman-специфичной) оценке Devin показала лишь 3 из 20 успешно выполненных задач — контрдоказательство к маркетинговым цифрам. Итог — уровень C: самоотчёт вендора/банка на стадии пилота, без измеренного банк-специфичного результата.",
   "outcome": "unknown",
   "outcome_basis_ru": "Цель (заявленная): развернуть сотни, потенциально тысячи экземпляров Devin как «нового сотрудника» под надзором ~12 000 разработчиков банка. TechCrunch (11.07.2025) фиксирует стадию пилота без метрик результата. Публично называемые метрики улучшения Devin («4x быстрее», рост доли смерженных PR с 34% до 67%, «2x» по ресурсам) взяты из собственного годового обзора Cognition (вендора), где методология — «examples and metrics from customers» в целом, не Goldman-специфичные измерения. Независимая проверка The Register (не про Goldman конкретно) выявила существенные ограничения агента (3 из 20 задач). Банк-специфичного измеренного результата (скорость разработки, качество кода, стоимость) не найдено ни в одном источнике.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [
    {
     "name_ru": "Численность разработчиков банка",
     "value": "12000",
     "unit": "человек (ориентировочно)",
     "period": "2025",
     "baseline": null,
     "source_url": "https://techcrunch.com/2025/07/11/goldman-sachs-is-testing-viral-ai-agent-devin-as-a-new-employee/"
    },
    {
     "name_ru": "Доля успешно смерженных PR Devin (общий показатель вендора, не Goldman-специфичный)",
     "value": "67 против 34 годом ранее",
     "unit": "%",
     "period": "18 месяцев с запуска Devin, обзор Cognition за 2025 г.",
     "baseline": "34%",
     "source_url": "https://cognition.com/blog/devin-annual-performance-review-2025"
    }
   ],
   "claims": [
    {
     "claim_ru": "Goldman Sachs начинает тестировать Devin как «нового сотрудника»: планируется начать с сотен экземпляров, с возможным ростом до тысяч, при штате ~12 000 разработчиков.",
     "status": "SOURCE_CLAIM",
     "what_verified": "implementation_fact",
     "evidence": [
      {
       "url": "https://techcrunch.com/2025/07/11/goldman-sachs-is-testing-viral-ai-agent-devin-as-a-new-employee/",
       "title": "Goldman Sachs is testing viral AI agent Devin as a 'new employee'",
       "publisher": "TechCrunch",
       "published": "2025-07-11",
       "origin": "media_repeat",
       "quote_original": "We're going to start augmenting our workforce with Devin, which is going to be like our new employee",
       "quote_ru": "Мы начнём расширять наш штат с помощью Devin, который станет как бы нашим новым сотрудником"
      }
     ]
    },
    {
     "claim_ru": "Devin стал «в 4 раза быстрее», доля смерженных PR выросла с 34% до 67%, эффективность по ресурсам выросла в 2 раза — по собственному годовому обзору вендора Cognition, основанному на «примерах и метриках клиентов» в целом (Goldman упомянут только как один из клиентов списком, без отдельных цифр).",
     "status": "SOURCE_CLAIM",
     "what_verified": "number_in_report",
     "evidence": [
      {
       "url": "https://cognition.com/blog/devin-annual-performance-review-2025",
       "title": "Devin's 2025 Performance Review: Learnings From 18 Months of Agents At Work",
       "publisher": "Cognition (вендор Devin)",
       "published": "2025",
       "origin": "company",
       "quote_original": "Eighteen months after launch, Devin's gone from tackling small projects, to working in engineering teams at thousands of companies, including Goldman Sachs, Santander, and Nubank.",
       "quote_ru": "Через восемнадцать месяцев после запуска Devin прошёл путь от решения небольших задач до работы в инженерных командах тысяч компаний, включая Goldman Sachs, Santander и Nubank."
      }
     ]
    },
    {
     "claim_ru": "Независимая техническая проверка Devin (не Goldman-специфичная) показала успешное выполнение лишь 3 из 20 поставленных задач, с трудностями на сложных задачах и склонностью к галлюцинациям.",
     "status": "VERIFIED",
     "what_verified": "observed_result",
     "evidence": [
      {
       "url": "https://www.eweek.com/news/goldman-sachs-ai-coding-agent-devin/",
       "title": "Goldman Sachs Adds AI Developer Devin to Engineering Team",
       "publisher": "eWeek (со ссылкой на независимое тестирование The Register, январь 2025)",
       "published": "2025-07-14",
       "origin": "independent",
       "quote_original": "The agent successfully completed just three out of 20 assigned tasks.",
       "quote_ru": "Агент успешно выполнил лишь три из 20 поставленных задач."
      }
     ]
    }
   ],
   "arithmetic": [
    {
     "expr": "67% / 34% ≈ 1,97×",
     "result": "≈2× рост доли смерженных PR — близко к заявляемому вендором «2x» по ресурсной эффективности (хотя вендор относит «2x» к другому показателю — расходу ресурсов, не к PR)",
     "matches_source": false
    }
   ],
   "counter_evidence_ru": "Независимая техническая проверка (The Register, январь 2025) обнаружила, что агент «faltered on more complex ones, often pursuing infeasible solutions or hallucinating nonexistent features» — существенное ограничение, напрямую противоречащее маркетинговым заявлениям об эффективности «нового сотрудника».",
   "alternative_explanations_ru": "Рост показателей 34%→67% в обзоре Cognition охватывает всех клиентов агрегированно за 18 месяцев эволюции продукта в целом, а не специфически результаты Goldman Sachs; улучшение может отражать общее созревание модели/продукта, а не эффект именно в контексте банка.",
   "human_role_ru": "По заявлению CIO Argenti, Devin работает «под надзором разработчиков» — модель предполагает гибридную рабочую силу, где люди контролируют и направляют работу ИИ-агента, а не заменяются им.",
   "timeline_ru": "11.07.2025 — публикация TechCrunch о начале пилота Devin в Goldman Sachs; январь 2025 — независимое тестирование Devin (The Register) с результатом 3/20; 2025 (конец года) — публикация Cognition годового обзора с агрегированными по всем клиентам метриками, упоминающего Goldman в списке клиентов.",
   "limitations_ru": "Ни один источник не приводит банк-специфичных измеренных результатов (только общие вендорские метрики по всем клиентам и общие независимые тесты не про Goldman). Заявления 2026 года о расширении сотрудничества Goldman с Anthropic (онбординг клиентов, бухучёт сделок) недоступны (CNBC/Finextra — 403), отдельно не проверялись в рамках этой сущности.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C, исход unknown — банк-специфичного измеренного результата нет; правило 6 не выполнено по обоим условиям.",
   "sources_opened": [
    "https://techcrunch.com/2025/07/11/goldman-sachs-is-testing-viral-ai-agent-devin-as-a-new-employee/",
    "https://cognition.com/blog/devin-annual-performance-review-2025",
    "https://www.eweek.com/news/goldman-sachs-ai-coding-agent-devin/"
   ],
   "unreachable": [
    "https://www.forbes.com/sites/bernardmarr/2026/08/06/how-goldman-sachs-is-using-agentic-ai-for-software-engineering-at-scale/"
   ]
  },
  {
   "entity_id": "CAND-f62c1c879757ff6b",
   "label_ru": "Uber — Обработка обращений клиентов в службе поддержки",
   "evidence_level": "C",
   "level_basis_ru": "Лично открыт вторичный источник (Yahoo Finance/Benzinga, пересказ выступления CEO Uber на WEF Davos), содержащий прямые цитаты CEO — это интервью/самоотчёт руководителя компании, пересказанное независимым изданием, без метрик. Первичный источник (видео/страница WEF) недоступен (403). Независимого источника с собственным измерением эффекта смены подхода (от следования старым политикам к «рассуждающим» агентам) не найдено — уровень C.",
   "outcome": "unknown",
   "outcome_basis_ru": "Цель (по словам CEO): новая версия ИИ-агентов поддержки, «рассуждающая» над обращением вместо следования жёстким прежним политикам, должна оставлять клиента довольным после обращения. Хосровшахи охарактеризовал первую версию (следование старым политикам) как давшую «some improvement but failed to deliver larger gains», а новый подход — как «the most promising way forward», но не привёл ни одной количественной метрики (CSAT, время решения, доля автоматизации) для сравнения версий. Заявление сделано в формате конференционного выступления (Davos, январь–февраль 2026), а не отчёта с данными. Прогноз/направление ≠ измеренный результат.",
   "primary_category": "agentic_interaction",
   "extra_labels": [],
   "metrics": [],
   "claims": [
    {
     "claim_ru": "CEO Uber заявил, что первая версия ИИ поддержки (следование старым политикам) дала лишь ограниченное улучшение, а переход к «рассуждающим» агентам без жёстких старых правил — «наиболее перспективный путь вперёд».",
     "status": "SOURCE_CLAIM",
     "what_verified": "none",
     "evidence": [
      {
       "url": "https://finance.yahoo.com/news/uber-ceo-dara-khosrowshahi-says-203121736.html",
       "title": "Uber CEO Dara Khosrowshahi says...",
       "publisher": "Yahoo Finance (перепечатка Benzinga)",
       "published": "2026-02-04",
       "origin": "media_repeat",
       "quote_original": "Allowing the AI actually to reason through that and throwing away all of the old policies is turning out to be the most promising way forward.",
       "quote_ru": "Позволить ИИ действительно рассуждать над обращением, отбросив все старые политики, — это, как выясняется, наиболее перспективный путь вперёд."
      }
     ]
    }
   ],
   "arithmetic": [],
   "counter_evidence_ru": "Материал не содержит контрметрик, но сам факт отсутствия количественных данных при развёрнутой риторике об «наиболее перспективном пути» — сигнал того, что заявление является предварительной оценкой руководителя, а не подтверждённым результатом.",
   "alternative_explanations_ru": "Позитивная риторика CEO на публичной сессии WEF может быть частью корпоративного позиционирования Uber как технологического лидера, а не отражением измеренного операционного эффекта.",
   "human_role_ru": "Не описан явно; по общему контексту заявления — эскалация к людям для сложных случаев подразумевается, но не детализирована.",
   "timeline_ru": "Январь 2026 — выступление CEO на WEF Davos (точная дата сессии не подтверждена); 04.02.2026 — публикация пересказа на Yahoo Finance/Benzinga.",
   "limitations_ru": "Первичный источник (видео/страница WEF) недоступен (403 при проверке). Независимого источника с собственными данными по этому конкретному процессу (поддержка Uber) не найдено; статья Arize AI (август 2026) о том, «как Uber оценивает ИИ-агентов», оказалась про другой процесс — голосового агента бронирования поездок, а не про поддержку клиентов, и также основана на презентации сотрудника Uber (самоотчёт), поэтому не использована как свидетельство по этой сущности.",
   "counted_in_120_proposed": false,
   "reason_ru": "Уровень C, исход unknown — правило 6 не выполнено по обоим условиям.",
   "sources_opened": [
    "https://finance.yahoo.com/news/uber-ceo-dara-khosrowshahi-says-203121736.html",
    "https://arize.com/blog/how-uber-evaluates-ai-agents-at-production-scale/"
   ],
   "unreachable": []
  }
 ],
 "packet_notes_ru": "Пакет E4B-SEL-2, 8 сущностей. Фактическое число вызовов WebSearch: 14 (в пределах бюджета 30). WebFetch использован для всех известных primary_url/secondary_url и для целевых независимых источников, найденных через WebSearch; часть URL оказались недоступны (Forbes и StockTitan — 403/сбой сокета; EdSource — 403; england.nhs.uk — дважды вернул пустое содержимое) и помечены unreachable, вместо них использованы альтернативные независимые источники того же события, где удалось их найти. Итог по уровням: A — 0, B — 3 (Woolworths Olive, monday.com, Ingka/IKEA Billie), C — 5 (NHS England Copilot, Ocado, CSU×OpenAI, Goldman Sachs Devin, Uber). Исходы: mixed — 2 (Woolworths, Ingka/IKEA), unknown — 5 (monday.com, NHS, Ocado, Goldman Sachs, Uber), CSU×OpenAI — mixed (разнонаправленные самоотчётные показатели без независимого измерения). Предложено в 120 (counted_in_120_proposed=true): 2 — Woolworths Olive и Ingka/IKEA Billie (уровень B + установленный mixed-исход + документированная роль ИИ). Главные проблемы: почти все сущности волны B — самоотчёты вендоров/компаний или интервью руководителей без независимого измерения причинного эффекта ИИ на исход организации; объявленные решения (сокращения monday.com, пилоты Goldman/Ocado) систематически путаются в источниках с измеренным результатом; для NHS и Goldman Sachs заявленные впечатляющие цифры (43 минуты; 4x/67% vs 34%) при проверке оказались самоотчётом сторон, внедряющих продукт, что подтверждено независимыми комментаторами (iatroX, The Register)."
}
