{
 "packet_id": "W8-FIELD-WORK-4",
 "verifier": "claude-opus subagent",
 "finished_at": "2026-09-23T15:10:55",
 "entities": [
  {
   "entity_id": "W8-FIELD-WORK-4-01",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "B",
   "outcome": "failure",
   "counted_in_120": true,
   "issues_ru": [
    "Авторы внешние: Stray и Brandtzæg (Университет Осло), Wivestad, Barbala, Moe (SINTEF); сотрудников NAV среди авторов нет, в Acknowledgments только благодарность NAV IT. Данные происходят не от руководства NAV: публичные репозитории NAV IT на GitHub (26 317 коммитов, 703 репозитория) плюс собственный опрос и интервью авторов. Значит, у данных и у анализа другое происхождение, не такое, как у данных самой организации. Прецедент: полевое исследование в названной организации силами внешних авторов.",
    "Автор не указал, что статья прошла рецензирование: она опубликована в трудах HICSS-59 (2026), стр. 7413-7422, DOI 10.24251/HICSS.2026.880. Это укрепляет уровень B, но второго независимого измерения нет, поэтому A не ставлю.",
    "Все цитаты найдены в PDF v2 дословно. Арифметика: в статье +16 чистых строк в неделю; по числам 188/105 и 200/98 выходит +19. Автор это расхождение отметил.",
    "Ограничения, которые нужно явно учитывать в интерпретации: количественная выборка всего 39 разработчиков (25 пользователей и 14 не-пользователей) при 250 пользователях Copilot к маю 2025. Метрики основаны на коммитах. Внедрение было добровольным, поэтому есть самоотбор. Исход — отсутствие статистически значимого эффекта («minor increases were observed»), а не вред. Failure здесь означает, что цель «измеримый рост продуктивности» не достигнута; ухудшения качества кода не было."
   ],
   "added_evidence": [
    {
     "url": "https://arxiv.org/abs/2509.20353",
     "publisher": "arXiv / Proceedings of HICSS-59 (2026)",
     "published": "2025-09-24 (v1), 2026-01-28 (v2)",
     "origin": "academic",
     "quote_original": "We did not find any statistically significant changes in commit-based activity for Copilot users after they adopted the tool, although minor increases were observed.",
     "quote_ru": "Мы не обнаружили статистически значимых изменений в активности по коммитам у пользователей Copilot после начала использования инструмента, хотя наблюдался небольшой рост."
    }
   ],
   "sources_opened": [
    "https://arxiv.org/abs/2509.20353",
    "https://arxiv.org/pdf/2509.20353"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-02",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Решение по сути: это внешний рыночный шок (выход ChatGPT 30.11.2022), а не исход внедрения ИИ в работу самой Stack Overflow. DiD и synthetic control Burtch и др. (Scientific Reports, 06.05.2024) измеряют, как ChatGPT повлиял на трафик и число вопросов платформы. Процессы Stack Overflow в этом измерении не меняются. По прецеденту «внешний шок ≠ внедрение ИИ организацией» случай в 120 не засчитывается. Уровень B относится только к факту падения трафика: исследование академическое, данные SimilarWeb и публичные данные StackExchange.",
    "Разворот к продуктам Stack Internal и Stack Overflow for Agents — это продуктовая стратегия, а не измеренное изменение работы с помощью ИИ. Финансовые показатели приходят из раскрытия Prosus и не связаны с этим разворотом причинно. Сокращения 2023 г. компания объяснила макроэкономикой (TechCrunch, 17.10.2023). Поэтому outcome = unknown: исход внедрения ИИ самой организацией не измерен. Оценка mixed описывает бизнес-траекторию под внешним шоком.",
    "Фактическая ошибка в периоде. Статья Moneyweb опубликована 02.07.2026 и говорит о списаниях FY26. Фраза «In the year to 31 March... 12% increase in revenue to $129 million... $12 million from a loss of $9 million» относится к году до 31.03.2026, а не к FY2025, как пишет автор. Диапазоны «12-17%» и «$115-129 млн» смешивают разные периоды.",
    "Цитата TechCrunch в claims склеивает текст журналиста («While the post didn't elaborate…») и цитату CEO. Оба фрагмента на странице есть, но порядок в quote_original переставлен."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.nature.com/articles/s41598-024-61221-0",
    "https://www.moneyweb.co.za/news/companies-and-deals/prosus-slashes-valuation-of-ai-hit-subsidiary-by-more-than-half/",
    "https://techcrunch.com/2023/10/17/stack-overflow-cuts-28-of-its-staff"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-03",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "Это дубль CAND-b1ed1053c262e420: прежний вердикт C/failure, не засчитан (packets/E4A-UNK-01/verify.json). Новых данных нет. У автора те же две статьи The Register (21 и 22.07.2025) и вторичная сводка на GitHub (vectara/awesome-agent-failures). Причины уровня C не устранены. Это эксперимент одного пользователя (Лемкин, SaaStr), а не изменение процесса организации, и у сведений два заинтересованных источника: посты пострадавшего и заявление CEO вендора, которые The Register пересказывает. Независимого измерения ущерба нет.",
    "Метрика «1206 руководителей и 1196+ компаний удалены» в тексте статьи The Register не найдена: возможно, она есть только на скриншоте. При этом, по Лемкину, откат сработал («the rollback did work»), то есть безвозвратной потери данных не было. Формулировка «утраченных записей» преувеличивает ущерб.",
    "Цитаты в quote_original найдены на страницах дословно."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://www.theregister.com/2025/07/21/replit_saastr_vibe_coding_incident/",
    "https://www.theregister.com/2025/07/22/replit_saastr_response/"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-04",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "B",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "Это инцидент безопасности, а не исход изменения работы организации с помощью ИИ. Nx пострадала из-за ошибки в GitHub Actions: pull_request_target и инъекция через заголовок PR. Роль ИИ в процессах Nx не установлена: в постмортеме нет утверждения, что уязвимый workflow создан ИИ, и поиск этого не подтвердил. ИИ CLI-агенты жертв использовал атакующий как инструмент разведки. Ни одна организация не внедряла ИИ в процесс так, чтобы исходом стала эта атака. Прецедент «инцидент без изменения процесса» → не засчитывать.",
    "Уровень понижен с A до B. Факт атаки и её механика подтверждены из разных источников: постмортем Nx, The Hacker News со ссылками на Wiz, GitGuardian и StepSecurity, JFrog. Но количественные данные Wiz и GitGuardian (2349 секретов, 1346 репозиториев, 90% действующих токенов) автор видел только в пересказе The Hacker News; страница Wiz ему была недоступна. Первичный документ с прозрачным измерением лично не открыт, а это требование для уровня A.",
    "Неточность атрибуции: по The Hacker News 1346 репозиториев выявила GitGuardian, а в level_basis автор отнёс часть цифр к Wiz. Цитаты найдены на страницах дословно."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://nx.dev/blog/s1ngularity-postmortem",
    "https://thehackernews.com/2025/08/malicious-nx-packages-in-s1ngularity.html"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-05",
   "checked": true,
   "verdict": "reject_counting",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Уровень C не может попасть в 120: правило «только A/B». Авторы — сотрудники ANZ (Chatterjee, Liu, Rowland, Hogarth), данные и анализ одного происхождения, независимого подтверждения нет. Строгость A/B-дизайна внутри статьи уровень не поднимает.",
    "Эксперимент построен на 12 алгоритмических задачах на Python в контролируемой среде, а не на реальной рабочей нагрузке. Результат о 1000 инженерах в аннотации назван «early data».",
    "Исход: 42,36% (пересчёт (30,98−17,86)/30,98 = 42,34%, в статье есть обе цифры) и лучшее качество кода — это успех. По безопасности авторы признают результат неубедительным («inconclusive»), и это не отрицательный результат. Поэтому mixed заменён на success (самоотчёт). Цитаты найдены в PDF дословно."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/abs/2402.05636",
    "https://arxiv.org/pdf/2402.05636"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-08",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "unknown",
   "counted_in_120": false,
   "issues_ru": [
    "Авторы (Bakal, Dasdan, Katz, Kaufman, Levin) — сотрудники ZoomInfo; статья на arXiv и блог компании имеют одно происхождение. Уровень C верен. Полный текст автор не читал.",
    "Доля принятых подсказок (33%/20%), удовлетворённость (72%) и самооценка экономии времени — это показатели принятия инструмента и восприятия, а не исход работы (сроки, объём, качество, затраты). Цели, базы и измеренного результата нет, поэтому outcome заменён с mixed на unknown. Цитата из аннотации дословна, кроме фрагмента после «...», которого в аннотации нет."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/abs/2501.13282"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-09",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "success",
   "counted_in_120": false,
   "issues_ru": [
    "Выборочная проверка. Все три автора — сотрудники Microsoft, данные — внутренняя телеметрия и HR, так что происхождение одно, уровень C. Дизайн наблюдательный, «24%» — это контрфактическая оценка, а не результат рандомизации. Авторы сами оговаривают, что merged PR ≠ ценность. Цитата из аннотации дословна."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/abs/2607.01418"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-10",
   "checked": true,
   "verdict": "confirm",
   "evidence_level": "C",
   "outcome": "mixed",
   "counted_in_120": false,
   "issues_ru": [
    "Авторы — сотрудники Meta, уровень C верен. Mixed обоснован: в первом safety trial время ревью выросло больше чем на 5%, после смены UX регрессии нет, в продакшене ActionableToApplied = 19,7% (+9,2 п.п. к GPT-4o). Всё это есть в аннотации дословно. Даты испытаний не раскрыты. Контрольная группа внутренняя, внешнего подтверждения нет."
   ],
   "added_evidence": [],
   "sources_opened": [
    "https://arxiv.org/abs/2507.13499"
   ]
  },
  {
   "entity_id": "W8-FIELD-WORK-4-11",
   "checked": true,
   "verdict": "downgrade",
   "evidence_level": "C",
   "outcome": "failure",
   "counted_in_120": false,
   "issues_ru": [
    "Роль ИИ в исходе не установлена. Заявление Amazon (21.02.2026) подтверждает только кратковременный сбой одного сервиса (AWS Cost Explorer) в одном регионе в декабре. Kiro как причину и 13 часов простоя Amazon не подтверждает; компания прямо называет причиной ошибку пользователя с правами доступа («not AI»). Версия о Kiro, удаление и пересоздание окружения, 13 часов исходят только от анонимных источников FT. Автор FT не открывал (403) и цитирует её через блог поставщика ИИ-инфраструктуры (Barrack AI). GeekWire и прочие публикации пересказывают ту же статью FT, то есть второго независимого происхождения нет. Сбой установлен, роль ИИ оспорена, поэтому уровень C и в 120 не засчитывается. Прецедент: засчитываются случаи, где исход установлен независимо, как у CNET и Air Canada; здесь этого нет.",
    "Автор пропустил более позднее развитие: по сообщениям (в пересказе блога paddo.dev, первоисточник снова пресса), 5 марта 2026 Amazon.com был недоступен около 6 часов после «AI-assisted changes», а 10 марта SVP Dave Treadwell ввёл обязательное согласование старшим инженером для кода с участием ИИ от младших сотрудников. Это возможный отдельный кандидат, если найдётся первоисточник: Amazon тогда провела объявленное изменение процесса. Лично я его не проверял.",
    "Цитата Amazon в claims дословна, но фраза «This brief event…» есть в блоге Barrack, а на странице Amazon другая формулировка: «The brief service interruption they reported on…». У автора вариант со страницы Amazon верен."
   ],
   "added_evidence": [
    {
     "url": "https://www.aboutamazon.com/news/aws/aws-service-outage-ai-bot-kiro",
     "publisher": "Amazon",
     "published": "2026-02-21",
     "origin": "company",
     "quote_original": "The issue stemmed from a misconfigured role—the same issue that could occur with any developer tool (AI powered or not) or manual action.",
     "quote_ru": "Проблема возникла из-за неверно настроенной роли — та же проблема могла бы возникнуть с любым инструментом разработчика (с ИИ или без) или при ручном действии."
    },
    {
     "url": "https://paddo.dev/blog/kiro-escalation/",
     "publisher": "paddo.dev (блог, вторичный пересказ прессы)",
     "published": "2026-03",
     "origin": "independent",
     "quote_original": "On March 10, SVP Dave Treadwell convened an emergency engineering meeting. The outcome: a new policy requiring senior engineer sign-offs for AI-assisted code deployed by junior staff.",
     "quote_ru": "10 марта старший вице-президент Дэйв Тредвелл созвал экстренное инженерное совещание. Итог — новая политика, требующая согласования старшим инженером для кода с участием ИИ, развёртываемого младшими сотрудниками."
    }
   ],
   "sources_opened": [
    "https://www.aboutamazon.com/news/aws/aws-service-outage-ai-bot-kiro",
    "https://blog.barrack.ai/amazon-ai-agents-deleting-production/",
    "https://www.geekwire.com/2026/amazon-pushes-back-on-financial-times-report-blaming-ai-coding-tools-for-aws-outages/",
    "https://paddo.dev/blog/kiro-escalation/"
   ]
  }
 ],
 "unchecked_entity_ids": [
  "W8-FIELD-WORK-4-06",
  "W8-FIELD-WORK-4-07"
 ],
 "packet_notes_ru": "Проверено 9 из 11 сущностей: все 6 предложенных в 120, все mixed (02, 05, 08, 10) и 09 выборочно (25% от оставшихся). В 120 подтверждена одна: 01 NAV IT (B, failure). Внешние авторы UiO/SINTEF, данные из публичных репозиториев и собственного опроса, статья рецензирована (HICSS-59). Отклонены: 02 (внешний рыночный шок ChatGPT, Stack Overflow не внедряла ИИ в процесс), 03 (дубль CAND-b1ed1053c262e420, новых данных нет, C), 04 (инцидент безопасности, ИИ-агентами жертв злоупотребил атакующий; A понижен до B), 05 (C, самоотчёт ANZ), 11 (роль ИИ установлена только по анонимным источникам FT, Amazon отрицает; C). Системные ошибки автора: (1) инциденты и внешние шоки выданы за исходы изменения работы; (2) C включён в 120 вопреки правилу; (3) уровень A поставлен по цифрам, которые автор видел только в пересказе; (4) ошибки в периодах и числах: Moneyweb FY26 выдан за FY2025, «1206 записей удалены» при сработавшем откате; (5) показатели принятия инструмента (acceptance, удовлетворённость) выданы за исход. Фактическое число вызовов WebSearch: 2. Страницы и PDF скачивались через curl с User-Agent \"Mozilla/5.0\"; временные файлы лежали в папке пакета и удалены."
}