Дополнительный материал
Salesforce Koa: An Enterprise Language Model for Agentic Tool Use
ID исходника: I2-SCI-0035. Слой: iteration2-v0.1.
Проекция исходной записи для навигации. Принятие исследовательского выпуска не подтверждает автоматически каждое утверждение. Каноническая запись — найти по ID.
Содержание и границы
Вывод работы: Пост-тренинг GRPO на спецификациях агентов (Agent Script) улучшает открытую базовую модель Nemotron-3-Super-120B на всех трёх бенчмарках, сильнее всего — на многораундовом использовании инструментов (Tau2Bench: 69.41 против 68.64 у базовой модели, на 14.9 балла выше GPT-4.1); на собственном CRM Bench итоговый балл 0.86 — близко к Claude Opus 4.8 (0.87), выше GPT-4.1 (0.81) и базовой модели (0.84), но ниже самых сильных проприетарных моделей. Авторы прямо оговаривают: сопоставление RL-vs-SFT сделано от уже RL-пост-тренированной базы и может не подтвердиться для до-RL чекпойнта.
Объём чтения: full_text
transfer_limits: Это отчёт вендора о собственной модели на собственных и публичных бенчмарках — не независимое исследование и не наблюдение за эффектом в компании-клиенте (используются только публичные и синтетические данные, без клиентских данных). Оценка CRM Bench — однораундовые (single-turn) задачи, тогда как многие реальные CRM-workflow многораундовые; сами авторы указывают ключевое ограничение: их базовая модель уже была RL-пост-тренирована, поэтому вывод «RL сильнее SFT» специфичен для этой отправной точки и не обязательно обобщается на до-RL чекпойнт. Перенос баллов бенчмарка на реальную эксплуатационную надёжность (например, безопасность необратимых действий, частоту отказов в проде) в статье не измеряется.
Продолжение: Следить за публичным релизом CRM Bench (упомянут как «released enterprise benchmark») и за независимыми проверками модели Koa вне вендорских бенчмарков.
Темы
Продажи и клиентский сервис · Агентная экономика и инфраструктура
Внешние материалы
Сохранённые оригиналы
Связаны по точному URL, а не по одному издателю.