{"id": "P24-SCI-MFG-W01", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["TRADE", "arxiv", "cs.AI", "benchmark", "customs", "HTS_classification"], "title": "ATLAS: Benchmarking and Adapting LLMs for Global Trade via Harmonized Tariff Code Classification", "authors": ["Pritish Yuvraj", "Siva Devarakonda"], "repository": "arXiv", "arxiv_id": "2509.18400", "first_version_date": "2025-09-22", "last_version_date": "2025-09-22", "peer_reviewed_version": null, "work_type": "method_or_simulation", "setting": "Офлайн-бенчмарк на реальных данных: датасет из 18 731 решения (rulings) Таможенно-пограничной службы США (CBP) из системы CROSS, held-out тест 200 примеров; сравнение готовых LLM и дообученной (SFT) модели Atlas (LLaMA-3.3-70B).", "process_link": "Классификация товаров по Гармонизированной тарифной системе (HTS/HS) — таможенное оформление и торговый комплаенс.", "key_finding_ru": "Авторы впервые собрали открытый бенчмарк для классификации по HTS-кодам на основе реальных таможенных решений CBP (CROSS) и дообучили LLaMA-3.3-70B (модель Atlas). Atlas достигает 40% полностью верных классификаций на уровне 10 знаков и 57,5% на уровне 6 знаков — выше GPT-5-Thinking (25% и 55,5% соответственно) и Gemini-2.5-Pro-Thinking (13,5% и 31%), при этом инференс дешевле в 5–8 раз и модель можно развернуть локально (приватность данных). Тем не менее даже лучшая модель верно классифицирует только 40% товаров на полном 10-значном уровне — задача остаётся далёкой от промышленной надёжности.", "metrics": [{"metric": "Полностью верная классификация (10 знаков), Atlas", "value": "40.0", "unit": "%", "original_number": "40%", "baseline": "GPT-5-Thinking 25.0%; Gemini-2.5-Pro-Thinking 13.5%; LLaMA-3.3-70B (без дообучения) 2.1%", "status": "SOURCE_CLAIM"}, {"metric": "Частично верная классификация (6 знаков), Atlas", "value": "57.5", "unit": "%", "original_number": "57.5%", "baseline": "GPT-5-Thinking 55.5%", "status": "SOURCE_CLAIM"}, {"metric": "Стоимость 1000 инференсов, Atlas (self-hosted)", "value": "~0.70", "unit": "USD", "original_number": "∼$0.70", "baseline": "GPT-5-Thinking ∼$3.30; Gemini-2.5-Pro-Thinking ∼$5.50", "status": "SOURCE_CLAIM"}], "transfer_limits": "Результаты получены на офлайн-бенчмарке из письменных решений CBP (текстовые описания товаров), а не в живом потоке таможенного оформления; тестовая выборка мала (200 примеров), классы (2992 HTS-кода) представлены неравномерно — присутствуют в CROSS только спорные/уточняемые коды. Даже лучшая модель верна в 40% случаев на 10-значном уровне, то есть без человеческой проверки система не готова к автономному использованию в реальном оформлении деклараций; авторы сами называют бенчмарк «высоко сложным».", "reading_scope": "full_text", "claims": [{"text_ru": "Дообученная модель Atlas (LLaMA-3.3-70B) достигает 40% полностью верных 10-значных классификаций HTS против 25% у GPT-5-Thinking и 13,5% у Gemini-2.5-Pro-Thinking на held-out тесте из 200 таможенных решений CROSS.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (точность классификации)", "source_url": "https://arxiv.org/abs/2509.18400", "locator": "раздел 4.1, таблица 2"}, {"text_ru": "Инференс Atlas обходится примерно в 5 раз дешевле GPT-5-Thinking и в 8 раз дешевле Gemini-2.5-Pro-Thinking на 1000 классификаций (по оценке авторов на основе публичных цен API и аренды GPU).", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (стоимость инференса)", "source_url": "https://arxiv.org/abs/2509.18400", "locator": "раздел 4.5, таблица 5"}], "sources": [{"url": "https://arxiv.org/abs/2509.18400", "title": "ATLAS: Benchmarking and Adapting LLMs for Global Trade via Harmonized Tariff Code Classification", "publisher": "arXiv", "author": "Pritish Yuvraj, Siva Devarakonda", "date": "2025-09-22", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F01"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Мониторить обновления версии (v2) и появление рецензируемой публикации; следить за расширением бенчмарка на другие юрисдикции (не только США)."}
{"id": "P24-SCI-MFG-W02", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["TRADE", "arxiv", "cs.AI", "customs", "HS_classification", "agentic_workflow", "China"], "title": "A Deterministic Agentic Workflow for HS Tariff Classification: Multi-Dimensional Rule Reasoning with Interpretable Decisions", "authors": ["Yu Zhang", "Dongjiang Zhuang", "Qu Zhou", "Zheng Huang", "Junhe Wu", "Jing Cao", "Kai Chen"], "repository": "arXiv", "arxiv_id": "2605.14857", "first_version_date": "2026-05-14", "last_version_date": "2026-05-14", "peer_reviewed_version": null, "work_type": "method_or_simulation", "setting": "Офлайн-бенчмарк HSCodeComp (632 товарных описания с экспертной разметкой из крупной e-commerce платформы) + ручной аудит 226 расхождений экспертом по таможенной классификации; часть авторов аффилирована с Главным таможенным управлением КНР (GACC, Шанхай) и Шанхайским университетом Цзяотун.", "process_link": "Классификация товаров по Гармонизированной системе (HS) для таможенного оформления — китайский регуляторный контекст.", "key_finding_ru": "Авторы предлагают «детерминированный» агентный конвейер (в отличие от самопланирующих агентов): жёсткая последовательность из шести стадий, где LLM решает узкие задачи и обязана цитировать конкретные примечания к разделам/главам тарифа. На бенчмарке HSCodeComp конвейер с топовой моделью Qwen3.6-plus даёт 75,0% top-1 (91,5% top-3) точности на уровне 4 знаков и 64,2% top-1 (78,3% top-3) на уровне 6 знаков; открытая модель Qwen3.6-27B-FP8 в том же конвейере совпадает с топовой моделью в 84,2% случаев на 4 знаках — то есть выигрыш даёт сама архитектура конвейера, а не мощность конкретной модели. Ручной аудит 226 расхождений с эталоном показал, что заметная часть «ошибок» — это спорные пограничные случаи или огрехи разметки самого бенчмарка, а не ошибки системы.", "metrics": [{"metric": "Точность top-1, 6 знаков (Qwen3.6-plus)", "value": "64.2", "unit": "%", "original_number": "64.2%", "baseline": "top-3: 78.3%", "status": "SOURCE_CLAIM"}, {"metric": "Согласие открытой модели (27B) с топовой моделью, top-1, 4 знака", "value": "84.2", "unit": "%", "original_number": "84.2%", "baseline": null, "status": "SOURCE_CLAIM"}, {"metric": "Скорректированная точность top-1 (6 знаков) после аудита разметки", "value": "~85.8", "unit": "%", "original_number": "approximately 85.8%", "baseline": "консервативная оценка авторов, без второй экспертной проверки", "status": "HYPOTHESIS"}], "transfer_limits": "Оценка проведена на одном офлайн-бенчмарке (HSCodeComp, товары e-commerce), а не в потоке реального таможенного оформления; текст называет систему «production-grade» и упоминает «несколько production-релизов» (v7), но не приводит данных о фактическом объёме деклараций, обработанных в реальной работе GACC — статус промышленного внедрения не подтверждён документом и не может быть принят как факт эксплуатации. Ручной аудит расхождений проведён теми же авторами (не независимая сторона), что ограничивает объективность корректировки точности.", "reading_scope": "full_text", "claims": [{"text_ru": "Детерминированный шестистадийный агентный конвейер с явным цитированием примечаний к разделам/главам HS даёт 64,2% top-1 точности на уровне 6 знаков на бенчмарке HSCodeComp (632 товара) с моделью Qwen3.6-plus.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (точность классификации)", "source_url": "https://arxiv.org/abs/2605.14857", "locator": "раздел IV.B, таблица I"}, {"text_ru": "Система описана как прошедшая «несколько production-релизов» (v7), однако документ не приводит данных о фактическом объёме реальных таможенных деклараций, обработанных системой в промышленной эксплуатации.", "status": "UNKNOWN", "verification_scope": "факт внедрения в реальную эксплуатацию", "source_url": "https://arxiv.org/abs/2605.14857", "locator": "раздел IV.A, «Versioning»"}], "sources": [{"url": "https://arxiv.org/abs/2605.14857", "title": "A Deterministic Agentic Workflow for HS Tariff Classification: Multi-Dimensional Rule Reasoning with Interpretable Decisions", "publisher": "arXiv", "author": "Yu Zhang, Dongjiang Zhuang, Qu Zhou, Zheng Huang, Junhe Wu, Jing Cao, Kai Chen", "date": "2026-05-14", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F02"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Проверить, появится ли публикация с данными о реальном объёме деклараций, обработанных системой в GACC (заявленный «production» статус пока не подтверждён численно)."}
{"id": "P24-SCI-MFG-W03", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["MFG", "arxiv", "cs.AI", "predictive_maintenance", "foundation_model", "transformer"], "title": "FreqCondNorm: Towards Cross-domain Predictive Maintenance through a Frequency-Conditioned Transformer Foundation Model", "authors": ["Zaynab Raounak", "Camille L'Herminé", "Zhiguo Zeng"], "repository": "arXiv", "arxiv_id": "2609.20535", "first_version_date": "2026-09-17", "last_version_date": "2026-09-17", "peer_reviewed_version": null, "work_type": "method_or_simulation", "setting": "Лабораторный бенчмарк: предобучение на пяти публичных наборах данных predictive maintenance (CWRU, MFPT, UOC18, PRONOSTIA, CMAPSS) с частотами дискретизации от 1 Гц до ~100 кГц; перенос на 5 задач (диагностика неисправностей, few-shot, zero-shot между доменами, прогноз остаточного ресурса).", "process_link": "Предиктивное обслуживание промышленного оборудования (диагностика неисправностей вращающегося/возвратно-поступательного оборудования, прогноз остаточного ресурса).", "key_finding_ru": "Авторы (CentraleSupélec) предлагают архитектуру FreqCondNorm — трансформер с нормализацией, обусловленной частотой дискретизации сигнала (FiLM-слой вместо LayerNorm), что позволяет объединить в одной модели сигналы с частотами, различающимися на пять порядков. Модель, названная авторами «в стиле foundation model» (но не foundation model в полном смысле — корпус предобучения скромный, 5 датасетов), достигает 99,2% точности на CWRU (+6,4 п.п. к сильной CNN-базовой модели) и 82,1% точности в режиме zero-shot на датасете MFPT, не видимом при предобучении. При этом на задаче прогноза остаточного ресурса (RUL) предобучение не улучшает результат по сравнению с базовой моделью без предобучения — авторы объясняют это несоответствием задачи предобучения (masked auto-encoding + contrastive) целевой RUL-задаче.", "metrics": [{"metric": "Точность диагностики неисправностей, CWRU", "value": "99.2", "unit": "%", "original_number": "99.2%", "baseline": "+6.4 п.п. к сильной CNN-базовой модели", "status": "SOURCE_CLAIM"}, {"metric": "Точность zero-shot на MFPT (домен не участвовал в предобучении)", "value": "82.1", "unit": "%", "original_number": "82.1%", "baseline": null, "status": "SOURCE_CLAIM"}], "transfer_limits": "Все данные — публичные лабораторные датасеты с искусственно вызванными дефектами (CWRU, MFPT, UOC18, PRONOSTIA, CMAPSS), а не сигналы с реального промышленного оборудования в эксплуатации; авторы прямо пишут, что распределения таких данных расходятся с реальными условиями эксплуатации. Модель не улучшает прогноз остаточного ресурса (RUL) — то есть выигрыш ограничен задачами диагностики/классификации неисправностей и не переносится на все задачи PdM. Корпус предобучения (5 датасетов) авторы сами называют «скромным» относительно типичного масштаба foundation-моделей.", "reading_scope": "full_text", "claims": [{"text_ru": "FreqCondNorm достигает 99,2% точности диагностики неисправностей на датасете CWRU при leakage-free разбиении по run-ID, что на 6,4 п.п. выше сильной CNN-базовой модели.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (точность на бенчмарке)", "source_url": "https://arxiv.org/abs/2609.20535", "locator": "аннотация; основной текст"}, {"text_ru": "Предложенный подход предобучения не улучшает точность прогноза остаточного ресурса (RUL) по сравнению с моделью без предобучения — ограничение, которое авторы связывают с несоответствием задачи предобучения целевой RUL-задаче.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (отсутствие улучшения на RUL)", "source_url": "https://arxiv.org/abs/2609.20535", "locator": "аннотация"}], "sources": [{"url": "https://arxiv.org/abs/2609.20535", "title": "FreqCondNorm: Towards Cross-domain Predictive Maintenance through a Frequency-Conditioned Transformer Foundation Model", "publisher": "arXiv", "author": "Zaynab Raounak, Camille L'Herminé, Zhiguo Zeng", "date": "2026-09-17", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F03"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Следить за публикацией версии с реальными промышленными (не лабораторными) сигналами и за рецензируемой версией."}
{"id": "P24-SCI-MFG-W04", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["MFG", "arxiv", "cs.AI", "scheduling", "simulation_based_optimization", "AGV", "agent"], "title": "LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling", "authors": ["Jinbo Li", "Chuanhao Li"], "repository": "arXiv", "arxiv_id": "2608.09343", "first_version_date": "2026-08-10", "last_version_date": "2026-08-10", "peer_reviewed_version": null, "work_type": "method_or_simulation", "setting": "Дискретно-событийная симуляция (DES) динамического производства и планирования автоматических робокар (AGV): синтетическая модель с тремя производственными линиями, общим складом сырья, зарядкой AGV и случайными сбоями оборудования; тестирование на 100 совпадающих сценариях (seeds) и отдельно на удлинённом горизонте.", "process_link": "Оперативное планирование производства и внутризаводской логистики (диспетчеризация AGV, приоритеты транспортных задач, проактивная зарядка).", "key_finding_ru": "Авторы (Университет Цинхуа) предлагают фреймворк, где LLM-агент («менеджер») анализирует не только агрегатные оценки политики, но и пошаговые трассы симуляции (какие узкие места возникли), формулирует гипотезы о причинах и параллельно генерирует код-правки политики; агенты-редакторы вносят изменения, лучшие варианты сохраняются. В DES-кейсе динамического производства и AGV-диспетчеризации по пяти независимым запускам с Gemini-3.1-Pro средняя итоговая оценка составила 77,51 из 100; в лучшем запуске трассовая диагностика привела к проактивной зарядке, дистанционно-осознанному назначению AGV и перебалансировке приоритетов, подняв лучшую-на-текущий-момент среднюю оценку с 62,49 до 78,61. На 100 совпадающих сценариях лучшая найденная политика превзошла эталонные rolling-MILP, rule-based и метаэвристические политики на каждом (100%) сценарии и сохранила преимущество при случайных сбоях оборудования без повторной оптимизации.", "metrics": [{"metric": "Средняя итоговая оценка политики (5 запусков, шкала 0-100)", "value": "77.51", "unit": "баллов из 100", "original_number": "77.51", "baseline": null, "status": "SOURCE_CLAIM"}, {"metric": "Рост лучшей-на-текущий-момент средней оценки в лучшем запуске", "value": "62.49 -> 78.61", "unit": "баллов из 100", "original_number": "62.49 to 78.61", "baseline": null, "status": "SOURCE_CLAIM"}, {"metric": "Доля из 100 совпадающих сценариев, где лучшая политика превзошла все базовые методы", "value": "100", "unit": "%", "original_number": "every seed", "baseline": "rolling-MILP, rule-based, метаэвристика", "status": "SOURCE_CLAIM"}], "transfer_limits": "Всё исследование выполнено в синтетической дискретно-событийной симуляции, разработанной самими авторами, а не на реальном производственном участке; сравнение ведётся с базовыми политиками (MILP, rule-based, метаэвристика), реализованными теми же авторами, что не исключает смещения в пользу предложенного метода. Стоимость и время работы самого LLM-агента (число обращений к модели, вычислительные затраты) в приведённых фрагментах не детализированы для прямого сравнения с операционными затратами внедрения на реальном заводе.", "reading_scope": "full_text", "claims": [{"text_ru": "В лучшем из пяти запусков оптимизации трассовая диагностика узких мест LLM-агентом подняла лучшую-на-текущий-момент среднюю оценку политики с 62,49 до 78,61 (шкала симулятора 0-100).", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (оценка политики в симуляции)", "source_url": "https://arxiv.org/abs/2608.09343", "locator": "аннотация"}, {"text_ru": "На 100 совпадающих тестовых сценариях лучшая найденная политика превзошла представительные rolling-MILP, rule-based и метаэвристические политики на каждом сценарии.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (сравнение с базовыми методами на 100 сценариях)", "source_url": "https://arxiv.org/abs/2608.09343", "locator": "аннотация"}], "sources": [{"url": "https://arxiv.org/abs/2608.09343", "title": "LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling", "publisher": "arXiv", "author": "Jinbo Li, Chuanhao Li", "date": "2026-08-10", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F04"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Следить за переносом метода на реальный завод/симулятор с реальными данными, а не полностью синтетическую модель."}
{"id": "P24-SCI-MFG-W05", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["MFG", "arxiv", "cs.AI", "quality", "predictive_maintenance", "inspection", "agent", "China"], "title": "ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs", "authors": ["Bingchen Liu", "Yuanyuan Fang", "Lei Liu", "Guangyuan Dong", "Xing Fu", "Yuanyuan Gao", "Shuyue Wei", "Xin Li", "Xiangtian Meng"], "repository": "arXiv", "arxiv_id": "2607.28126", "first_version_date": "2026-07-30", "last_version_date": "2026-08-10", "peer_reviewed_version": null, "work_type": "method_or_simulation", "setting": "Офлайн-эксперименты на датасете из ~30 080 реальных записей осмотра сталелитейного оборудования + 15-дневное полевое испытание в действующей системе инспекции промышленного партнёра (сталелитейное предприятие на севере Китая, один из соавторов аффилирован с Rizhao Steel Holding Group).", "process_link": "Техническое обслуживание и контроль качества оборудования: LLM-ассистированный скрининг раннего риска по журналам периодических осмотров (человек-в-контуре).", "key_finding_ru": "Авторы предлагают ConMem — архитектуру памяти для LLM-ассистента осмотра оборудования, которая оценивает вклад (через Shapley-подобную оценку) каждой единицы исторических записей осмотра в диагностику и хранит только наиболее ценные записи в рамках бюджета памяти. На офлайн-датасете реальных записей осмотра ConMem достигает 76,0% точности (QA accuracy), сокращая число входных токенов на 88,2% и время отклика на 86,6% по сравнению с наивным LLM-базлайном с полным контекстом 8К токенов. В отдельном 15-дневном полевом испытании на действующем производстве (1125 задач осмотра, 375 подтверждённых аномалий) ConMem дал recall 78,7% против 53% у порогового метода и 58% у RAG без оценки вклада записей, предупреждая о деградации оборудования в среднем за 12 дней до подтверждения при плановом осмотре; авторы прямо указывают, что система работает как инструмент приоритизации риска для инспектора, а не как автоматическая замена профессионального осмотра.", "metrics": [{"metric": "Точность (QA accuracy) на офлайн-датасете", "value": "76.0", "unit": "%", "original_number": "76.0%", "baseline": "наивный LLM-базлайн с полным контекстом 8K токенов", "status": "SOURCE_CLAIM"}, {"metric": "Recall в 15-дневном полевом испытании (1125 задач осмотра)", "value": "78.7", "unit": "%", "original_number": "78.7%", "baseline": "пороговый метод 53%; raw-log RAG 58%", "status": "SOURCE_CLAIM"}, {"metric": "Среднее опережение предупреждения относительно планового осмотра", "value": "12", "unit": "дней", "original_number": "an average of 12 days", "baseline": null, "status": "SOURCE_CLAIM"}], "transfer_limits": "Полевое испытание длилось всего 15 дней на одном предприятии-партнёре (сталелитейная отрасль, Северный Китай) — короткий срок и единичный объект не позволяют переносить количественные показатели (recall, дни опережения) на другие отрасли, типы оборудования или более длительные периоды эксплуатации; система также генерирует ощутимую долю неподтверждённых предупреждений (136 из общего числа), что означает дополнительную нагрузку на инспекторов при проверке ложных срабатываний. Авторы прямо обозначают систему как вспомогательный инструмент приоритизации, а не замену человеческого осмотра.", "reading_scope": "full_text", "claims": [{"text_ru": "ConMem достигает 76,0% точности на офлайн-датасете реальных записей осмотра стального оборудования, сокращая входные токены на 88,2% и время отклика на 86,6% относительно наивного LLM с полным контекстом.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (точность и эффективность на офлайн-датасете)", "source_url": "https://arxiv.org/abs/2607.28126", "locator": "аннотация; раздел 5 (эксперименты)"}, {"text_ru": "В 15-дневном полевом испытании на действующем сталелитейном предприятии ConMem корректно предупредил о 295 из 375 подтверждённых аномалий (recall 78,7%) против 53% у порогового метода и 58% у raw-log RAG, в среднем на 12 дней раньше планового осмотра.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта и факт внедрения (полевое испытание на одном предприятии)", "source_url": "https://arxiv.org/abs/2607.28126", "locator": "раздел 6 (Deployment and Case Study), таблица 7"}], "sources": [{"url": "https://arxiv.org/abs/2607.28126", "title": "ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs", "publisher": "arXiv", "author": "Bingchen Liu, Yuanyuan Fang, Lei Liu, Guangyuan Dong, Xing Fu, Yuanyuan Gao, Shuyue Wei, Xin Li, Xiangtian Meng", "date": "2026-07-30", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:16Z", "file_id": "P24-SCI-MFG-F05"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Проверить, публиковалось ли предприятие-партнёр (возможно Rizhao Steel) собственное подтверждение результатов; следить за расширением полевого испытания на больший период/несколько предприятий."}
{"id": "P24-SCI-MFG-W06", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["TRADE", "MFG", "arxiv", "cs.AI", "supply_chain_planning", "agent", "GenAI", "China", "field_deployment"], "title": "Rethinking Supply Chain Planning: A Generative Paradigm", "authors": ["Jiaheng Yin", "Yongzhi Qi", "Jianshen Zhang", "Dongyang Geng", "Zhengyu Chen", "Hao Hu", "Wei Qi", "Zuo-Jun Max Shen"], "repository": "arXiv", "arxiv_id": "2509.03811", "first_version_date": "2025-09-04", "last_version_date": "2026-01-09", "peer_reviewed_version": null, "work_type": "empirical_field", "setting": "Полевое исследование внутри реальной операционной среды JD.com (китайская e-commerce платформа, ~10 млн SKU, сеть из 8 млн предприятий-клиентов): генеративный агентный фреймворк планирования цепочки поставок, развёрнутый в продуктиве с декабря 2023 года; для оценки взят срез из более чем 70 000 SKU в трёх бизнес-юнитах (бакалея/масла, товары для матери и ребёнка, малая бытовая техника), сравнение год-к-году (май-июнь 2024 против мая-июня 2023, включая пик распродажи «618»).", "process_link": "Планирование цепочки поставок e-commerce: прогнозирование спроса, управление запасами, входящая логистика и операционное планирование.", "key_finding_ru": "Авторы (JD.com и Университет Цинхуа/HKU/Berkeley) переопределяют планирование цепочки поставок не как вычислительную задачу, а как интерактивный, интегрированный и автоматизированный когнитивный процесс, и реализуют это в виде генеративного агентного фреймворка, встроенного в реальную операционную среду JD.com с декабря 2023 года. По собственным данным компании, фреймворк сократил еженедельные трудозатраты планировщика на подготовку данных со 120 до примерно 5 минут, повысил долю планов с высокой точностью (отклонение запасов <5% от целевого) на 22 процентных пункта (год-к-году, май-июнь 2024 против 2023) и удержал уровень выполнения заказов (stock fulfillment rate) на 2 п.п. выше исторического ручного бейзлайна в пик распродажи «618»; авторы также оценивают дополнительный прирост GMV в период фестиваля примерно в 2 млн юаней.", "metrics": [{"metric": "Сокращение еженедельного времени планировщика на подготовку данных", "value": "120 -> ~5", "unit": "минут в неделю", "original_number": "120 minutes to approximately 5 minutes", "baseline": "ручной процесс (до внедрения)", "status": "SOURCE_CLAIM"}, {"metric": "Рост доли планов с точностью отклонения запасов <5% (год-к-году)", "value": "22", "unit": "процентных пунктов", "original_number": "22%", "baseline": "май-июнь 2023 (ручной процесс) vs май-июнь 2024 (агентная система)", "status": "SOURCE_CLAIM"}, {"metric": "Превышение уровня выполнения заказов над историческим ручным бейзлайном (фестиваль «618»)", "value": "2", "unit": "процентных пункта", "original_number": "2% above the historical manual baseline", "baseline": "исторический ручной бейзлайн", "status": "SOURCE_CLAIM"}, {"metric": "Оценочный прирост GMV в период фестиваля «618»", "value": "~2", "unit": "млн юаней (RMB)", "original_number": "approximately RMB 2 million", "baseline": null, "status": "HYPOTHESIS"}], "transfer_limits": "Все количественные эффекты — самооценка компании-разработчика (JD.com, авторы статьи — сотрудники JD.com), без независимой верификации; сравнение год-к-году (май-июнь 2024 vs май-июнь 2023) не является контролируемым A/B-экспериментом и подвержено смешению с другими изменениями платформы за год (сезонность, прочие ИТ-улучшения, рыночная конъюнктура). Оценка охватывает не всю сеть JD.com, а выборку из 70 000+ SKU в трёх бизнес-юнитах — перенос на всю компанию или на другие ритейл-платформы с иной структурой ассортимента и логистики не гарантирован. Оценка прироста GMV (~2 млн юаней) — расчётная (estimate), а не измеренная напрямую величина.", "reading_scope": "full_text", "claims": [{"text_ru": "С декабря 2023 года генеративный агентный фреймворк планирования работает в реальной продуктивной среде JD.com и по состоянию на статью продолжает итеративно дорабатываться.", "status": "SOURCE_CLAIM", "verification_scope": "факт внедрения в реальную эксплуатацию", "source_url": "https://arxiv.org/abs/2509.03811", "locator": "раздел 4, «From Design to Deployment»"}, {"text_ru": "По данным годового сравнения май-июнь 2024 (агентная система) против мая-июня 2023 (ручной процесс) на выборке 70 000+ SKU, доля планов с высокой точностью выросла на 22 процентных пункта, а еженедельная трудоёмкость подготовки данных для планировщика сократилась со 120 до ~5 минут.", "status": "SOURCE_CLAIM", "verification_scope": "величина эффекта (самооценка компании-разработчика без независимой верификации)", "source_url": "https://arxiv.org/abs/2509.03811", "locator": "раздел 4, подразделы «Process Efficiency» и «Decision Quality»"}], "sources": [{"url": "https://arxiv.org/abs/2509.03811", "title": "Rethinking Supply Chain Planning: A Generative Paradigm", "publisher": "arXiv", "author": "Jiaheng Yin, Yongzhi Qi, Jianshen Zhang, Dongyang Geng, Zhengyu Chen, Hao Hu, Wei Qi, Zuo-Jun Max Shen", "date": "2025-09-04", "type": "arxiv_preprint", "locator": "полный текст, версия v2 (9 января 2026)", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F06"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Сверить с известной карточкой JD.com в known-e4-cases.json (30-дневный полевой эксперимент с ORPR RL-агентом пополнения запасов «закуски») — это другой процесс (планирование vs. пополнение запасов), дублирования нет, но оба относятся к AI-инициативам JD.com в снабжении; следить за независимыми подтверждениями цифр (пресс, аналитики)."}
{"id": "P24-SCI-MFG-W07", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["MFG", "TRADE", "arxiv", "math.OC", "review", "operations_research", "scheduling", "survey"], "title": "Large Language Models for Operations Research: A Comprehensive Survey", "authors": ["Xianchao Xiu", "Jianhao Li", "Jun Fan", "Wanquan Liu"], "repository": "arXiv", "arxiv_id": "2605.20849", "first_version_date": "2026-05-20", "last_version_date": "2026-05-20", "peer_reviewed_version": null, "work_type": "review", "setting": "Систематический обзор литературы (LLM4OR) по трём этапам конвейера исследования операций: постановка модели, разработка алгоритма, верификация решения; включает раздел прикладных сценариев (планирование, диспетчеризация, транспорт, цепочки поставок) и обзор бенчмарк-датасетов.", "process_link": "Исследование операций (OR) как поддержка принятия решений в планировании производства, диспетчеризации цехового уровня (job shop scheduling), маршрутизации/логистике и цепочках поставок.", "key_finding_ru": "Обзор систематизирует применение LLM на трёх этапах решения задач исследования операций — формулировка модели, разработка алгоритма и верификация решения — и отдельно разбирает прикладные сценарии, включая цеховое планирование (job shop scheduling), маршрутизацию транспорта и цепочки поставок (в частности упоминается OptiGuide, апробированный на реальном облачном supply chain кейсе Microsoft). Авторы называют ключевыми нерешёнными проблемами: точность LLM на сложных датасетах часто ниже 50%, существующие исследования по большей части ограничены малыми датасетами и не масштабируются до промышленных задач с миллионами переменных; тестовые бенчмарки в основном взяты из учебников, а не из реальных индустриальных кейсов; чувствительность промышленных данных создаёт барьер для облачных LLM и требует офлайн/приватных решений; интерпретируемость результатов остаётся ключевым нерешённым приоритетом.", "metrics": [], "transfer_limits": "Это обзорная (review) работа: она не производит собственных новых эмпирических измерений эффекта, а обобщает результаты множества первичных исследований разного качества и с разными датасетами (преимущественно учебными/бенчмарковыми, не индустриальными). Авторы сами указывают на отсутствие единых стандартов оценки в области LLM4OR, что ограничивает сопоставимость цифр между цитируемыми работами и перенос выводов на конкретный производственный или логистический процесс без проверки первоисточника.", "reading_scope": "full_text", "claims": [{"text_ru": "На большинстве существующих сложных бенчмарков OR точность применения LLM остаётся ниже 50%, а исследования по большей части ограничены малыми датасетами, что затрудняет масштабирование на промышленные задачи с миллионами переменных.", "status": "SOURCE_CLAIM", "verification_scope": "существование ограничения (обзорная оценка авторов на основе цитируемых работ)", "source_url": "https://arxiv.org/abs/2605.20849", "locator": "раздел 8.1 (Framework Exploration)"}, {"text_ru": "Существующие бенчмарк-датасеты для LLM4OR в основном происходят из учебников и не отражают сложность и разнообразие реальных индустриальных сценариев OR.", "status": "SOURCE_CLAIM", "verification_scope": "существование ограничения (обзорная оценка авторов)", "source_url": "https://arxiv.org/abs/2605.20849", "locator": "раздел 8.2 (Dataset Construction)"}], "sources": [{"url": "https://arxiv.org/abs/2605.20849", "title": "Large Language Models for Operations Research: A Comprehensive Survey", "publisher": "arXiv", "author": "Xianchao Xiu, Jianhao Li, Jun Fan, Wanquan Liu", "date": "2026-05-20", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F07"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Использовать как карту литературы для будущих итераций пакета (список первичных работ по planning/scheduling/supply chain в математике/OR); не цитировать цифры из обзора как первичные без сверки с оригиналом."}
{"id": "P24-SCI-MFG-W08", "record_kind": "work", "novelty": "new", "prior_id": null, "stream_primary": "SCIENCE", "tags": ["TRADE", "arxiv", "cs.AI", "RAG", "enterprise_deployment", "AI_governance", "UK", "field_deployment"], "title": "TVS Sidekick: Challenges and Practical Insights from Deploying Large Language Models in the Enterprise", "authors": ["Paula Reyero Lobo", "Kevin Johnson", "Bill Buchanan", "Matthew Shardlow", "Ashley Williams", "Samuel Attwood"], "repository": "arXiv", "arxiv_id": "2509.26482", "first_version_date": "2025-09-30", "last_version_date": "2025-09-30", "peer_reviewed_version": "Accepted at EthicalLLMs@RANLP2025 (workshop, по данным поля Comments на странице arXiv)", "work_type": "empirical_field", "setting": "Кейс-стади реального корпоративного внедрения: внутренний AI-ассистент Sidekick (RAG поверх корпоративных документов через расширение Microsoft Teams) в TVS Supply Chain Solutions UK (топ-уровневый 3PL-провайдер), совместно с Manchester Metropolitan University; мониторинг использования за 4 месяца (март-июнь 2025) и 24 качественных интервью с сотрудниками ИТ-департамента.", "process_link": "Внутренний доступ сотрудников 3PL-логистического провайдера к корпоративным знаниям и коду через LLM-ассистента (вспомогательный процесс поддержки ИТ/разработки, не прямое управление физическими цепочками поставок).", "key_finding_ru": "TVS Supply Chain Solutions (топ-уровневый 3PL-провайдер в Великобритании/Европе) развернула собственный RAG-ассистент Sidekick, встроенный в Microsoft Teams, отказавшись от стороннего ПО в пользу внутренней AI-команды, и внедрила систему мониторинга использования в рамках требований ISO/IEC 42001 (управление AI) и EU AI Act. За 4 месяца наблюдения (март-июнь 2025) зафиксировано устойчивое использование: свыше 500 запросов в первые два месяца и около 250 в следующие два, среднее время отклика ~46 секунд, явное разделение на «ранних последователей» (46–253 запроса на пользователя) и разовых пользователей (менее 20 запросов); наиболее активными были ИТ-специалисты и бизнес-роли (управление тендерами, бизнес-аналитики). 24 качественных интервью с сотрудниками ИТ показали в целом позитивное отношение (энтузиазм у 11 из опрошенных) при опасениях по поводу конфиденциальности данных клиентов и угрозы рабочим местам (упомянуто 8 респондентами), без серьёзных инцидентов безопасности за отчётный период.", "metrics": [{"metric": "Число запросов к Sidekick, первые 2 месяца мониторинга", "value": ">500", "unit": "запросов", "original_number": "exceeding 500 prompts in the first two months", "baseline": null, "status": "SOURCE_CLAIM"}, {"metric": "Число запросов к Sidekick, следующие 2 месяца мониторинга", "value": "~250", "unit": "запросов", "original_number": "250 in the following two months", "baseline": null, "status": "SOURCE_CLAIM"}, {"metric": "Среднее время отклика системы (пиковые даты)", "value": "46", "unit": "секунд", "original_number": "46 seconds on average", "baseline": null, "status": "SOURCE_CLAIM"}], "transfer_limits": "Sidekick — это внутренний ИТ/knowledge-ассистент (RAG по корпоративным документам, код, SharePoint), а не система, напрямую управляющая логистическими или таможенными операциями TVS SCS — несмотря на то, что компания работает в сфере supply chain, сам инструмент относится к общекорпоративной поддержке знаний, а не к профильному процессу цепочки поставок. Данные охватывают лишь 4 месяца после запуска и преимущественно ИТ-департамент (24 интервью с сотрудниками ИТ), без данных о влиянии на бизнес-метрики компании (стоимость, скорость обработки грузов и т.п.) — перенос выводов на эффективность операций TVS SCS в целом не подтверждён документом.", "reading_scope": "full_text", "claims": [{"text_ru": "TVS Supply Chain Solutions UK развернула внутреннего RAG-ассистента Sidekick на базе Microsoft Teams, отказавшись от сторонних вендоров, и в течение 4-месячного периода мониторинга (март-июнь 2025) зафиксировала устойчивое использование — свыше 500 запросов в первые два месяца и около 250 в следующие два, при среднем времени отклика 46 секунд.", "status": "SOURCE_CLAIM", "verification_scope": "факт внедрения и масштаб использования", "source_url": "https://arxiv.org/abs/2509.26482", "locator": "раздел 5.1 (Adoption & Usage), рис. 3"}, {"text_ru": "По итогам 24 качественных интервью с сотрудниками ИТ-департамента TVS SCS основные опасения касались конфиденциальности клиентских данных и угрозы рабочим местам, без серьёзных инцидентов безопасности за отчётный период.", "status": "SOURCE_CLAIM", "verification_scope": "факт (содержание качественной обратной связи сотрудников)", "source_url": "https://arxiv.org/abs/2509.26482", "locator": "раздел 5.2 (Qualitative Feedback)"}], "sources": [{"url": "https://arxiv.org/abs/2509.26482", "title": "TVS Sidekick: Challenges and Practical Insights from Deploying Large Language Models in the Enterprise", "publisher": "arXiv", "author": "Paula Reyero Lobo, Kevin Johnson, Bill Buchanan, Matthew Shardlow, Ashley Williams, Samuel Attwood", "date": "2025-09-30", "type": "arxiv_preprint", "locator": "полный текст", "reading_scope": "full_text", "accessed_at": "2026-09-24T23:15Z", "file_id": "P24-SCI-MFG-F08"}], "author_model": "claude-sonnet-5", "reviewer": "", "next_action": "Следить за публикацией второго раунда обратной связи и за расширением мониторинга за пределы ИТ-департамента; проверить организацию TVS Supply Chain Solutions на дубли в будущих пакетах по логистике/3PL."}
