{
  "packet_id": "W8-FIELD-WORK-9",
  "executor": "claude-sonnet subagent",
  "finished_at": "2026-09-23T16:00:00Z",
  "status": "submitted",
  "entities": [
    {
      "entity_id": "W8-FIELD-WORK-9-01",
      "label_ru": "Amplifi (Benefit Navigator) и Nava Labs — ИИ-чат-бот для соцработников по льготам: офлайн-РКИ и 14-недельный пилот в шести организациях округа Лос-Анджелес",
      "company": "Amplifi (ранее Imagine LA) — некоммерческая организация (501(c)(3)), владелец инструмента Benefit Navigator; пилот прошёл в сети из шести человеко-ориентированных организаций социальных услуг округа Лос-Анджелес, Калифорния (конкретные названия шести организаций не раскрыты в открытом отчёте); ИИ-чат-бот и офлайн-эксперимент разработаны Nava Public Benefit Corporation (подразделение Nava Labs) совместно с Better Government Lab (Georgetown University) и Department of Information Science (Cornell Tech)",
      "country": "США",
      "process": "Работа кейсворкеров (соцработников, консультантов по льготам) некоммерческих и государственных организаций: консультирование клиентов о праве на федеральные/штатные пособия (Medicaid, CalFresh/SNAP, CalWORKs и др.) и помощь в подаче заявлений. Внедрён генеративный ИИ-чат-бот (retrieval-augmented generation по проверенным источникам), встроенный в веб-инструмент Benefit Navigator, для ответа на вопросы кейсворкеров в реальном времени",
      "period": "Офлайн-эксперимент — осень (Fall) 2025; реальный пилот с клиентами — 11 марта – 11 июня 2025 (14 недель); отчёт опубликован 13 марта 2026",
      "region": "US",
      "evidence_level": "B",
      "level_basis_ru": "Лично открыт и прочитан первичный документ — отчёт 'Helping the Helpers: Evaluating a GenAI-powered assistive chatbot for caseworkers' (Nava PBC, 13.03.2026, PDF). Авторский коллектив состоит из 3 сотрудников Nava PBC (компания-разработчик ИИ-инструмента, заинтересованная сторона) и 4 независимых исследователей из двух внешних академических центров — Better Government Lab (Georgetown University) и Department of Information Science (Cornell Tech); институциональные IRB Georgetown и Cornell рассматривали офлайн-эксперимент. Большинство соавторов — внешние по отношению к компании-разработчику, есть реальное внедрение в работу 61 кейсворкера в шести реальных организациях (не выдуманная исследователями работа) — соответствует прецеденту 'большинство внешних авторов + меньшинство от компании + реальная работа + внедрение → B'. Офлайн-эксперимент по измерению точности методологически строгий (РКИ, вопросы откалиброваны панелью аудиторов CalFresh QC), но использовал не реальный ИИ-бот, а симулированные ответы с заданной точностью (60–65% / 85–90% / ≥95%); реальный пилот — квазиэксперимент (intervention/comparison по сайтам, не рандомизация), данные по клиентам не собирались (только опыт кейсворкеров). Независимого подтверждения результатов сторонним источником другого происхождения (кроме соавторства двух университетов) не найдено — это ограничивает случай уровнем B, не A.",
      "outcome": "mixed",
      "outcome_basis_ru": "Цель 1 (офлайн-РКИ, точность): использование симулированного чат-бота статистически значимо повышало точность ответов кейсворкеров на вопросах по программе CalFresh (control без бота vs три уровня симулированной точности бота) — эффект значим (p<0.01–0.001), сильнее на сложных вопросах. Реально развёрнутый бот Nava по качеству соответствует категории 'better' (85–90% точности). Цель 2 (реальный пилот, административная нагрузка кейсворкеров): предпилотные/постпилотные изменения нагрузки (learning/compliance/psychological cost) — направление ожидаемое (снижение learning и psychological cost), но эффект статистически не значим из-за малой выборки (n=39 с обеими анкетами) и низкого отклика на итоговый опрос. Цель 3 (принятие/удовлетворённость): 65% кейсворкеров с доступом пользовались ботом (в среднем 14 промптов), но вовлечённость снижалась со временем и варьировала по площадкам; NPS = 11 (умеренная, смешанная удовлетворённость: 40% 'промоутеров', остальные — менее воодушевлены). Разнонаправленность (значимый успех в контролируемом измерении точности vs статистически не подтверждённый эффект в реальном пилоте на административную нагрузку и неоднозначное принятие) → mixed. Влияние на клиентов (получили ли они больше льгот) не измерялось вовсе (данные по клиентам не собирались).",
      "primary_category": "process_restructuring",
      "extra_labels": [],
      "metrics": [
        {"name_ru": "Рост точности ответов кейсворкеров (симулированный бот категории 'better', ≈85–90% точности)", "value": "+24", "unit": "п.п. (≈40% относительно контроля)", "period": "офлайн-РКИ, осень 2025", "baseline": "контрольная группа без подсказок бота", "source_url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf"},
        {"name_ru": "Рост точности (симулированный бот категории 'best', ≥95% точности), по рис. 1", "value": "+33.1", "unit": "п.п. (p<0.001)", "period": "офлайн-РКИ, осень 2025", "baseline": "контрольная группа", "source_url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf"},
        {"name_ru": "Доля кейсворкеров, использовавших чат-бот в реальном пилоте", "value": "65", "unit": "% (в среднем 14 промптов на пользователя)", "period": "11.03.2025–11.06.2025", "baseline": "n/a", "source_url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf"},
        {"name_ru": "Net Promoter Score кейсворкеров по чат-боту", "value": "11", "unit": "NPS", "period": "итоговый опрос, июнь 2025", "baseline": "n/a", "source_url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf"}
      ],
      "claims": [
        {"claim_ru": "Реальный пилот проведён с 61 кейсворкером в шести человеко-ориентированных организациях округа Лос-Анджелес в сети Amplifi", "status": "VERIFIED", "what_verified": "implementation_fact",
          "evidence": [{"url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf", "title": "Helping the Helpers: Evaluating a GenAI-powered assistive chatbot for caseworkers", "publisher": "Nava Public Benefit Corporation (Nava Labs), совместно с Better Government Lab (Georgetown University) и Cornell Tech", "published": "2026-03-13", "origin": "independent", "quote_original": "Nava Labs recruited 61 caseworkers across six human services agencies (sites) in Los Angeles County within Amplifi's network to participate in the assistive chatbot pilot.", "quote_ru": "Nava Labs привлекла 61 кейсворкера из шести организаций социальных услуг (площадок) округа Лос-Анджелес в сети Amplifi для участия в пилоте чат-бота."}]},
        {"claim_ru": "Чат-бот, по оценке офлайн-эксперимента, в среднем повышает точность кейсворкеров на 40%", "status": "VERIFIED", "what_verified": "observed_result",
          "evidence": [{"url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf", "title": "Helping the Helpers: Evaluating a GenAI-powered assistive chatbot for caseworkers", "publisher": "Nava PBC / Better Government Lab / Cornell Tech", "published": "2026-03-13", "origin": "independent", "quote_original": "Overall, the assistive chatbot increased accuracy scores by approximately 24 percentage points, representing a 40% improvement relative to the control group.", "quote_ru": "В целом, ассистивный чат-бот повысил показатели точности примерно на 24 процентных пункта, что представляет собой 40%-е улучшение относительно контрольной группы."}]},
        {"claim_ru": "Эффект снижения административной нагрузки (learning/psychological cost) в реальном пилоте статистически не значим", "status": "VERIFIED", "what_verified": "observed_result",
          "evidence": [{"url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf", "title": "Helping the Helpers: Evaluating a GenAI-powered assistive chatbot for caseworkers", "publisher": "Nava PBC / Better Government Lab / Cornell Tech", "published": "2026-03-13", "origin": "independent", "quote_original": "While none of these pre-post differences were statistically significant, the overall pattern of findings offer promising insight into how administrative burden evolved during the pilot and can help guide future improvements to the chatbot.", "quote_ru": "Хотя ни одно из этих изменений «до/после» не было статистически значимым, общая картина результатов даёт многообещающее представление о том, как менялась административная нагрузка в ходе пилота, и может помочь в дальнейшем улучшении чат-бота."}]},
        {"claim_ru": "Данные о клиентах (получили ли они льготы) в рамках пилота не собирались", "status": "VERIFIED", "what_verified": "implementation_fact",
          "evidence": [{"url": "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf", "title": "Helping the Helpers: Evaluating a GenAI-powered assistive chatbot for caseworkers", "publisher": "Nava PBC / Better Government Lab / Cornell Tech", "published": "2026-03-13", "origin": "independent", "quote_original": "To protect privacy and minimize security risks, we didn't collect client-level data.", "quote_ru": "Для защиты конфиденциальности и минимизации рисков безопасности мы не собирали данные на уровне клиентов."}]}
      ],
      "arithmetic": [
        {"expr": "24 п.п. / 0.40 = подразумеваемая базовая точность контрольной группы", "result": "≈60%", "matches_source": true},
        {"expr": "Сверка figure 1 (Better=+17.7 п.п., Best=+33.1 п.п.) против текста стр.23 ('better' и 'best' группы показали на 24 и 25 п.п. выше контроля)", "result": "числа в тексте и на графике отчёта не совпадают между собой (17.7 vs 24 для 'better'; 33.1 vs 25 для 'best')", "matches_source": false}
      ],
      "counter_evidence_ru": "Внутри самого отчёта Nava Labs есть внутреннее расхождение цифр: на стр. 23 текст утверждает, что группы 'better' и 'best' показали точность на 24 и 25 п.п. выше контроля, тогда как рисунок 1 (стр. 24) показывает +17.7 п.п. для 'better' и +33.1 п.п. для 'best' — то есть числа по 'better' в тексте выше, чем на графике, а по 'best' — ниже. Похоже, что разные разделы отчёта используют разные подвыборки/методы агрегации, но это не поясняется явно.",
      "alternative_explanations_ru": "Офлайн-эксперимент измерял не реальное поведение чат-бота, а симулированные ответы с заранее заданной калиброванной точностью (60–65% / 85–90% / ≥95%) на искусственных многовариантных вопросах по CalFresh — это условия, приближенные к реальной работе, но не сама реальная работа с реальными клиентами; риск переноса результата на реальный чат-бот ограничен тем, что реальный чат-бот 'находится в категории better', то есть эффект +17.7…24 п.п. — более реалистичная оценка, чем +33.1…25 п.п. для 'best'.",
      "human_role_ru": "Кейсворкеры сохраняют полный контроль: в контролируемом эксперименте они могли принять или отвергнуть предложенный ответ; интервью показывают, что кейсворкеры используют бота как инструмент 'тройной проверки' перед тем, как давать информацию клиенту, а не как замену собственной экспертизы.",
      "timeline_ru": "Февраль 2024 — Nava Labs запускает исследовательскую программу ИИ для кейсворкеров; далее разработка ассистивного чат-бота и ещё четырёх ИИ-инструментов (по состоянию на октябрь 2025 остальные четыре — в статусе пилотирования/proof-of-concept, вне рамок данного отчёта); 11.03.2025–11.06.2025 — 14-недельный реальный пилот с 61 кейсворкером; осень 2025 — офлайн-РКИ на 125 кейсворкерах; 13.03.2026 — публикация итогового отчёта.",
      "limitations_ru": "Компания-разработчик (Nava PBC) — соавтор и партнёр по внедрению, то есть не полностью независима от результата; конкретные названия шести организаций-участниц пилота не раскрыты; независимого стороннего подтверждения результатов (например, отдельного аудита или второй публикации с иным происхождением данных) не найдено — только внутреннее академическое соавторство Georgetown/Cornell. Дальнейший веб-поиск последующих событий (после марта 2026) не проводился из-за исчерпанного лимита WebSearch.",
      "counted_in_120_proposed": true,
      "reason_ru": "Уровень B (первичный документ лично открыт, большинство соавторов независимы от компании-разработчика, реальное внедрение в работу реальных организаций), исход установлен как смешанный (значимый эффект в контролируемом измерении точности vs статистически не подтверждённый эффект на административную нагрузку в реальном пилоте), роль ИИ в изменении работы кейсворкеров установлена документально.",
      "sources_opened": [
        "https://www.navapbc.com/case-studies/evaluating-ai-assistive-chatbot-caseworkers",
        "https://assets.ctfassets.net/t2ekr6eg3fr3/6Mw21Ui0jPkfXGW22BwUhb/9dc81c9ff2a9c251cfc9d484d071c17e/Helping_the_Helpers__Nava_Labs_March_2026.pdf"
      ],
      "unreachable": []
    },
    {
      "entity_id": "W8-FIELD-WORK-9-02",
      "label_ru": "City and County of Denver — муниципальный ИИ-чат-бот «Sunny» (Citibot/AWS) для службы 311: независимое журналистское тестирование выявило неровное качество и устаревшие данные наряду с хорошей работой в простых сценариях",
      "company": "City and County of Denver, Colorado (мэрия Денвера, департамент Technology Services и служба 311); подрядчик и разработчик платформы — компания Citibot (на базе AWS)",
      "country": "США",
      "process": "Обслуживание немедицинских обращений жителей в городскую службу 311 (выбоины, незаконная парковка, упавшие деревья, граффити, брошенные автомобили, вопросы по городским регламентам и мероприятиям): наряду с телефонной линией 311 (доступна 7:00–19:00 Пн–Пт) внедрён круглосуточный ИИ-чат-бот 'Sunny', отвечающий на основе базы знаний denvergov.org на 72 языках",
      "period": "Запуск — февраль/март 2024 (трёхлетний контракт с Citibot: $184 000 в первый год, ≈$100 000/год далее); независимое журналистское тестирование — 1 июня 2024; более широкий аудит городской службы 311 (не только чат-бота) — опубликован 21 августа 2025",
      "region": "US",
      "evidence_level": "B",
      "level_basis_ru": "Лично открыта и прочитана независимая статья Denver Westword (некоммерчески аффилированное с мэрией издание, 'The Leading Independent News Source in Denver'), где журналист лично провёл собственное тестирование чат-бота Sunny по ряду реальных денверских вопросов и зафиксировал результаты — это независимое от города и от вендора первичное наблюдение (не пересказ пресс-релиза), в дополнение к официальным фактам о контракте, стоимости и доле обращений через бота, также приведённым в той же статье со ссылкой на мэрию. Отдельно лично открыт независимый пересказ отчёта муниципального аудитора Денвера (Timothy M. O'Brien) от 21.08.2025 о работе службы 311 в целом (общие проблемы координации, не специфичные для чат-бота) — использован как контекст последующих событий, а не как основное доказательство по ИИ. Прямой текст самого отчёта аудитора (PDF на denvergov.org) открыть не удалось — сайт блокировал автоматические запросы (see unreachable).",
      "outcome": "mixed",
      "outcome_basis_ru": "Цель/метрика 1 (обработка стандартных транзакционных обращений — репорт о выбоине): журналист лично протестировал подачу заявки на ремонт выбоины через Sunny — процесс прошёл гладко и был признан быстрее и проще телефонного звонка ('10/10'). Цель/метрика 2 (информационные и разговорные запросы вне узкой транзакционной задачи): бот систематически давал неверные или устаревшие ответы — путал денверский Бродвей с нью-йоркским, ссылался на мероприятия и данные 2019–2022 годов как на актуальные (симпозиум по марихуане 2019 года, MLB All-Star Game 2021 года, продление программы летних веранд 2020 года), не смог ответить по существу на вопрос о свинце в водопроводной воде дома и о статусе психоделиков, не знает локальных культурных тем. Итог по независимому тестированию — mixed (хорошо на простых стандартизированных транзакциях, плохо на информационных/актуальных вопросах). Отдельно, обращение к более позднему (авг. 2025) городскому аудиту показывает, что более широкая проблема — недостаточная координация между 311 и городскими ведомствами (не специфично к ИИ-компоненту), на этом фоне город в 2025–2026 гг. сокращал часы работы живой линии 311 и штат агентов, расширяя роль Sunny — то есть решение о расширении принято до/без полной независимой оценки эффективности самого чат-бота.",
      "primary_category": "process_restructuring",
      "extra_labels": ["adjacent_automation"],
      "metrics": [
        {"name_ru": "Доля обращений в 311, обработанных через Sunny", "value": "12", "unit": "% от всех обращений в 311", "period": "по состоянию на май 2024 (со слов мэрии)", "baseline": "n/a", "source_url": "https://www.westword.com/news/denver-ai-chatbot-sunny-knows-basics-cant-help-on-hot-topics-20891202/"},
        {"name_ru": "Стоимость контракта с Citibot", "value": "184000 (1-й год), ~100000/год (2-3 годы)", "unit": "USD", "period": "трёхлетний контракт с 2024", "baseline": "n/a", "source_url": "https://www.westword.com/news/denver-ai-chatbot-sunny-knows-basics-cant-help-on-hot-topics-20891202/"}
      ],
      "claims": [
        {"claim_ru": "На простой транзакционной задаче (заявка на ремонт выбоины) бот сработал быстро и корректно", "status": "VERIFIED", "what_verified": "observed_result",
          "evidence": [{"url": "https://www.westword.com/news/denver-ai-chatbot-sunny-knows-basics-cant-help-on-hot-topics-20891202/", "title": "Just How Bright Is Sunny, Denver's New AI Chatbot?", "publisher": "Denver Westword", "published": "2024-06-01", "origin": "independent", "quote_original": "Time will tell if that pothole gets dealt with, but reporting it it was much easier and quicker using Sunny than it would be making a phone call. On potholes, Sunny gets a 10/10.", "quote_ru": "Время покажет, займутся ли этой выбоиной, но сообщить о ней через Sunny было гораздо легче и быстрее, чем звонить по телефону. По выбоинам Sunny заслуживает 10 из 10."}]},
        {"claim_ru": "На неструктурированных/актуальных вопросах бот даёт неверные, устаревшие или уклончивые ответы", "status": "VERIFIED", "what_verified": "observed_result",
          "evidence": [{"url": "https://www.westword.com/news/denver-ai-chatbot-sunny-knows-basics-cant-help-on-hot-topics-20891202/", "title": "Just How Bright Is Sunny, Denver's New AI Chatbot?", "publisher": "Denver Westword", "published": "2024-06-01", "origin": "independent", "quote_original": "Again, Sunny also provides several random, outdated links to former mayor Michael Hancock's 2021 Mayor's Design Awards Winners, creative ways to celebrate Preservation Month from May 2021, and an announcement that Denver extended its temporary outdoor dining program in 2020.", "quote_ru": "Также Sunny выдаёт несколько случайных устаревших ссылок — на победителей премии мэра по дизайну 2021 года (при прошлом мэре Майкле Хэнкоке), на способы отметить месяц охраны памятников в мае 2021 года и на объявление о продлении временной программы летних веранд 2020 года."}]},
        {"claim_ru": "Более широкий городской аудит службы 311 (август 2025) выявил отсутствие скоординированного подхода между 311 и городскими ведомствами", "status": "VERIFIED", "what_verified": "publication",
          "evidence": [{"url": "https://nextdoor.com/agency-post/co/denver/denver-environmental-health/denver-311-and-partner-city-agencies-lack-a-coordinated-approach-to-effectively-manage-and-resolve-resident-requests-submitted-through-denver-311-according-to-a-new-audit-from-denver-auditor-timothy-m-420343066/", "title": "Denver 311 and partner city agencies lack a coordinated approach to effectively manage and resolve resident requests submitted through Denver 311", "publisher": "Office of the Auditor, City and County of Denver (репост через Nextdoor)", "published": "2025-08-21", "origin": "regulator", "quote_original": "Denver 311 and partner city agencies lack a coordinated approach to effectively manage and resolve resident requests submitted through Denver 311.", "quote_ru": "Служба 311 Денвера и партнёрские городские ведомства не имеют скоординированного подхода к эффективному управлению и разрешению обращений жителей, поданных через Denver 311."}]}
      ],
      "arithmetic": [],
      "counter_evidence_ru": "Городской аудит августа 2025 года не упоминает Sunny напрямую (по доступному мне тексту пересказа) — его претензии касаются координации между 311 и ведомствами в целом (например, ~39% сообщений по компостным бакам не по теме, случаи закрытия заявок без уведомления клиента), а не конкретно точности ответов ИИ-бота; это ограничивает связь между аудитом и оценкой именно ИИ-компонента.",
      "alternative_explanations_ru": "Слабые места Sunny (устаревшие ссылки, путаница по неоднозначным темам, отказ отвечать на вопросы вне заданной базы знаний) — типичное ограничение retrieval-based чат-бота с узкой базой знаний, а не специфическая проблема генеративного ИИ как такового; часть неудач (например, отсутствие актуальных мероприятий) отражает не обновляемость источников города, а не работу самой модели.",
      "human_role_ru": "Городской департамент Technology Services заявляет, что 'внимательно следит' за Sunny и совершенствует его; предусмотрен канал для жалоб на некорректные ответы через онлайн-хаб услуг. Оператор-человек на линии 311 остаётся доступен по будним дням 7:00–19:00; в 2025–2026 гг. живые часы работы сокращены на фоне бюджетного дефицита города (~$200 млн), а роль Sunny расширена.",
      "timeline_ru": "Февраль 2024 — запуск Sunny; 01.06.2024 — независимое тестирование Westword (данная запись); 21.08.2025 — публикация аудита службы 311 в целом; октябрь 2025 — по вторичным источникам (не открыты лично) — сокращение часов работы живой линии 311 и штата агентов на фоне бюджетного дефицита, расширение роли Sunny.",
      "limitations_ru": "Официальный текст аудиторского отчёта (PDF на denvergov.org) и статьи Colorado Politics/Denver Gazette/KDVR о решении 2025 года сократить часы 311 заблокировали автоматический доступ (HTTP 403 или WAF-ошибка) — соответствующие детали о связи сокращения штата именно с ролью Sunny взяты только из сниппетов поисковой выдачи, не из лично открытых страниц, и НЕ включены как проверенные claims (сняты из claims, упомянуты только как невходящий в состав доказательств контекст). Независимого измерения общей точности ответов Sunny (доля правильных ответов на репрезентативной выборке обращений) не существует — оценка основана на выборочном тестировании одним журналистом по ограниченному набору вопросов.",
      "counted_in_120_proposed": true,
      "reason_ru": "Уровень B: независимое издание провело собственное практическое тестирование инструмента (не пересказ пресс-релиза), результат которого документирован с прямыми цитатами и конкретными кейсами; исход установлен как смешанный (успех на транзакционных задачах, системные неудачи на информационных); роль ИИ в изменении процесса обслуживания 311 задокументирована официально (контракт, доля обращений).",
      "sources_opened": [
        "https://www.westword.com/news/denver-ai-chatbot-sunny-knows-basics-cant-help-on-hot-topics-20891202/",
        "https://nextdoor.com/agency-post/co/denver/denver-environmental-health/denver-311-and-partner-city-agencies-lack-a-coordinated-approach-to-effectively-manage-and-resolve-resident-requests-submitted-through-denver-311-according-to-a-new-audit-from-denver-auditor-timothy-m-420343066/",
        "https://afrikdigest.com/audit-report-reveals-denver-311-city-agencies-need-better-coordination-to-improve-services/"
      ],
      "unreachable": [
        "https://denvergov.org/files/assets/public/v/1/auditor/documents/audit-services/audit-reports/2025/denver-311_august-2025.pdf",
        "https://denvergov.org/files/assets/public/v/3/auditor/documents/audit-services/audit-reports/2025/denver-311_august-2025.pdf",
        "https://www.denvergov.org/Government/Agencies-Departments-Offices/Agencies-Departments-Offices-Directory/Auditors-Office/Audit-Services/Audit-Reports/Denver-311-and-Select-Agency-Case-Management",
        "https://www.coloradopolitics.com/2025/10/06/denver-311-service-hours-reduced-sunny-chatbot-takes-on-more/",
        "https://www.denvergazette.com/2025/10/06/denver-311-service-hours-reduced-sunny-chatbot-takes-on-more/",
        "https://kdvr.com/news/local/meet-sunny-denvers-ai-powered-chatbot/",
        "https://denver.prelive.opencities.com/files/assets/public/v/1/auditor/documents/audit-services/audit-reports/2025/agency-responses/2025-audit-response-_denver-311-audit_311.pdf"
      ]
    },
    {
      "entity_id": "W8-FIELD-WORK-9-03",
      "label_ru": "Юридическая помощь малоимущим (legal aid) в США — первое полевое исследование использования генеративного ИИ юристами: самоотчёт о росте продуктивности без независимого измерения исхода",
      "company": "91 участник (юристы и другие сотрудники) организаций юридической помощи малоимущим (legal aid) в США, получивших до двух месяцев платного доступа к инструментам генеративного ИИ; конкретные организации-участницы в открытой части публикации не названы. Оценка проведена независимыми исследователями — Colleen V. Chien (профессор права, UC Berkeley School of Law) и Miriam Kim, статья опубликована в Loyola of Los Angeles Law Review",
      "country": "США",
      "process": "Юридическая помощь малоимущим гражданам (access to justice): резюмирование документов, предварительное/подтверждающее юридическое исследование, подготовка первых черновиков процессуальных документов, перевод — с использованием платных инструментов генеративного ИИ; часть участников получила дополнительную 'консьерж'-поддержку (обмен кейсами, office hours), назначенную случайным образом",
      "period": "Пилот — до двух месяцев доступа к ИИ-инструментам на участника; параллельный опрос — 202 специалиста legal aid; публикация — Loyola of Los Angeles Law Review, том 57, №4 (2025)",
      "region": "US",
      "evidence_level": "C",
      "level_basis_ru": "Лично открыта страница публикации (Loyola of Los Angeles Law Review, digitalcommons.lmu.edu) с рефератом и описанием методологии; сам полный текст PDF статьи (SSRN и digitalcommons viewcontent) недоступен — сайты вернули HTTP 403. Несмотря на рецензируемую публикацию и независимость авторов (профессор права UC Berkeley, не сотрудник ни одной legal-aid организации и не вендор ИИ), ключевой заявленный результат ('90% участников сообщили о росте продуктивности') — это самоотчёт по опросу, а не независимо измеренный показатель (число обработанных дел, затраченное время, число обслуженных клиентов). Рандомизация в исследовании касалась только назначения 'консьерж'-поддержки, а не измерения самого исхода продуктивности. Согласно уроку 23.09 ('точность ≠ исход', 'независимость авторов ≠ независимость происхождения данных исхода') это соответствует уровню C: первичный документ (частично) открыт, но исход — самоотчёт.",
      "outcome": "success",
      "outcome_basis_ru": "Заявленная цель — рост продуктивности и способности обслуживать больше клиентов; метрика — доля участников, самостоятельно сообщивших о повышении продуктивности (90%) и о намерении продолжать использовать ИИ (75%); база — 91 участник; период — до двух месяцев пилота. Это самоотчётный положительный исход (respondents' perception), не независимо измеренный результат (нет данных по фактическому числу обработанных дел или обслуженных клиентов до/после), поэтому результат отмечен как 'success' по заявлению участников, но с оговоркой о низкой доказательной силе (уровень C).",
      "primary_category": "process_restructuring",
      "extra_labels": [],
      "metrics": [
        {"name_ru": "Доля участников, сообщивших о росте продуктивности", "value": "90", "unit": "% (самоотчёт)", "period": "по итогам пилота (до 2 месяцев доступа к ИИ)", "baseline": "n/a (самооценка после, без количественного до/после)", "source_url": "https://digitalcommons.lmu.edu/llr/vol57/iss4/2/"},
        {"name_ru": "Доля участников, намеренных продолжать использовать ИИ", "value": "75", "unit": "% (самоотчёт)", "period": "по итогам пилота", "baseline": "n/a", "source_url": "https://digitalcommons.lmu.edu/llr/vol57/iss4/2/"}
      ],
      "claims": [
        {"claim_ru": "91 участник получили до двух месяцев доступа к платным ИИ-инструментам, часть — с дополнительной 'консьерж'-поддержкой по случайному назначению", "status": "VERIFIED", "what_verified": "implementation_fact",
          "evidence": [{"url": "https://digitalcommons.lmu.edu/llr/vol57/iss4/2/", "title": "Generative AI and Legal Aid: Results from a Field Study and 100 Use Cases to Bridge the Access to Justice Gap", "publisher": "Loyola of Los Angeles Law Review (Loyola Law School)", "published": "2025", "origin": "academic", "quote_original": "Ninety-one participants received up to two months of access to paid generative AI tools. A randomly selected subset also received \"concierge\" support including peer use cases, office hours, and assistance.", "quote_ru": "Девяносто один участник получили до двух месяцев доступа к платным инструментам генеративного ИИ. Случайно выбранная подгруппа также получила «консьерж»-поддержку, включая примеры использования от коллег, часы консультаций и помощь."}]},
        {"claim_ru": "90% участников сообщили о росте продуктивности", "status": "SOURCE_CLAIM", "what_verified": "none",
          "evidence": [{"url": "https://digitalcommons.lmu.edu/llr/vol57/iss4/2/", "title": "Generative AI and Legal Aid: Results from a Field Study and 100 Use Cases to Bridge the Access to Justice Gap", "publisher": "Loyola of Los Angeles Law Review", "published": "2025", "origin": "academic", "quote_original": "90% of participants reported increased productivity", "quote_ru": "90% участников сообщили о росте продуктивности"}]}
      ],
      "arithmetic": [],
      "counter_evidence_ru": "Не найдено — полный текст статьи с методологическими деталями и возможными оговорками/ограничениями недоступен (SSRN и полный PDF заблокировали доступ, HTTP 403).",
      "alternative_explanations_ru": "Самоотчётный рост продуктивности может отражать эффект Хоторна (внимание к участникам пилота, бесплатный доступ к платному инструменту) или социально желательные ответы, а не объективный измеримый рост производительности.",
      "human_role_ru": "Участники сами выбирали, как и когда использовать ИИ; по открытой части реферата — предпочитали 'низкорисковые' применения (резюмирование, предварительное исследование, первые черновики, перевод), т.е. сохраняли контроль над финальным юридическим решением.",
      "timeline_ru": "Пилот — период не уточнён в открытой части (до 2 месяцев на участника); параллельный опрос 202 специалистов; публикация — 2025 год, том 57 №4 Loyola of Los Angeles Law Review.",
      "limitations_ru": "Полный текст статьи не открыт (SSRN и digitalcommons viewcontent — HTTP 403), поэтому недоступны точные даты пилота, названия организаций-участниц, детали статистического анализа и любые отрицательные/нулевые находки, которые могли быть в полном тексте. Дальнейший поиск альтернативного зеркала текста не проводился из-за исчерпанного лимита WebSearch.",
      "counted_in_120_proposed": false,
      "reason_ru": "Уровень C: ключевой заявленный исход — самоотчёт участников по опросу, не независимо измеренный показатель (нет данных по фактическому числу дел/клиентов/часов до и после). Несмотря на независимость авторов-исследователей и рецензируемую публикацию, по уроку 23.09 это не поднимает уровень до B/A, так как измерение исхода как такового остаётся зависимым от восприятия самих участников.",
      "sources_opened": [
        "https://digitalcommons.lmu.edu/llr/vol57/iss4/2/"
      ],
      "unreachable": [
        "https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4733061",
        "https://digitalcommons.lmu.edu/cgi/viewcontent.cgi?article=3210&context=llr"
      ]
    }
  ],
  "packet_notes_ru": "Фактическое число вызовов WebSearch: 29 (бюджет ≤30 соблюдён). Направление W8-FIELD-WORK-9: полевые эксперименты/staggered rollout/DiD 2023–2026 в конкретных организациях США и Канады по продажам, клиентскому сервису (страхование/банки/телеком/ритейл), маркетингу, юридическим/налоговым услугам, консалтингу, HR и кол-центрам госорганов — за вычетом уже известных кейсов (Brynjolfsson customer service, BCG, 11 патентных фирм, доставка еды и т.д.). Найдено и проверено 3 новых случая (все уровень B/B/C; исходы: mixed/mixed/success-самоотчёт); ни одного случая по чистым продажам B2B/розница, маркетингу/рекламе, консалтингу (кроме BCG), банкам/страхованию/телекому США или Канаде найти в пределах бюджета не удалось — по каждой из этих тем WebSearch систематически выводил либо уже известные исследования (Brynjolfsson 'Generative AI at Work' — Fortune 500 customer service, BCG, P&G 'Cybernetic Teammate' NBER w33641, кросс-бордер онлайн-ритейлер NBER/arXiv 2510.12049 = уже известен как W8-FIELD-WORK-3-02, Microsoft 365 Copilot 66 фирм NBER w33795 = уже известен как W8-FIELD-WORK-2-08, Alibaba customer service = Китай, вне региона), либо маркетинговый/индустриальный контент без строгого измерения исхода, либо кейсы за пределами США/Канады (например, найденный и отклонённый кандидат — полевой эксперимент с ИИ-переписыванием тона рабочих писем на 121 сотруднике шести компаний, но компании оказались в Израиле/Великобритании/Швеции/Украине, не в США/Канаде — arXiv 2607.11749). Кандидата по ИИ-коучингу менеджеров (упоминание 'Fortune 500 division, 120 менеджеров' в блоге Noomii) не включил: источник — маркетинговый блог без названия компании и без ссылки на первоисточник, уровень доказательности ниже D-порога. Ограничение по времени/бюджету не позволило продолжить поиск до достижения диапазона 10–14 случаев, установленного заданием; честно фиксирую это как незавершённость охвата, а не как попытку обойти лимит. Технические проблемы: сайт denvergov.org и несколько новостных сайтов (Colorado Politics, Denver Gazette, KDVR, SSRN, digitalcommons viewcontent) блокировали автоматический доступ (HTTP 403/WAF) нейтральным User-Agent (\"Mozilla/5.0\", без данных пользователя) — соответствующие URL отмечены как unreachable, факты из них не включены в claims/quotes.",
  "search_calls_used": 29
}
