AI Native
БиблиотекаПриложение

Дополнительный материал

When Better Turns Do Not Make Better Agents: Diagnosing the Gap Between Next-Turn Metrics and Workflow Success

ID исходника: I2-SCI-0040. Слой: iteration2-v0.1.

Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.

Содержание и границы

Вывод работы: SFT стабильно улучшает метрики «следующего шага» при корректной эталонной истории (all-turn success +19.3 п.п., с 28.5% до 47.7% в среднем по четырём моделям), но эти улучшения почти не переносятся на самостоятельное выполнение workflow: до SFT ни одна модель не завершала workflow с вызовом инструментов полностью; после SFT лучший результат (Qwen3-14B) — лишь 10.4% полных завершений workflow в замкнутом цикле, а по холистической (целостной) оценке судьи-LLM ни одна модель, до или после SFT, не показала ни одного полностью успешного workflow с инструментами (0/77 по всем восьми конфигурациям). Авторы делают вывод: сильные показатели «на следующем шаге» не являются надёжным индикатором способности агента довести workflow до конца, используя собственную историю решений — эволюция ошибок в начале диалога сказывается на последующих шагах, что gold-history протокол не улавливает.

Объём чтения: full_text

transfer_limits: Авторы сами указывают ограничения (раздел Limitations): оценка покрывает только два семейства моделей (Qwen3, Gemma 3) и один проприетарный домен клиентской поддержки (Dialpad), что ограничивает обобщаемость на другие домены и семейства моделей; замкнутый цикл (closed-loop replay) требует точного совпадения с эталонными вызовами инструментов и использует детерминированные эталонные реплики пользователя, что может отвергать валидные альтернативные решения агента и недооценивать реальное разнообразие взаимодействий. Датасет обучения (130 workflow) проприетарный и недоступен для внешней проверки. Работа не измеряет эффект на реальных метриках бизнеса (время решения обращения, удовлетворённость клиента) — только протокольные метрики оценки агента на тестовых workflow.

Продолжение: Использовать как ключевую иллюстрацию тезиса «оценка агента по следующему шагу переоценивает готовность к автономному workflow» — согласуется с находкой ERPBench (P27-SCI-ARXIV-AGENTS-W02) о том, что видимый успех на экране/шаге не гарантирует корректного итога.

Темы

Агентная экономика и инфраструктура

Внешние материалы

Сохранённые оригиналы

Связаны по точному URL, а не по одному издателю.

Каталог этого слоя и типа · Главная карта