AI Native
Разбор случая

UC San Diego Health — ИИ-черновики ответов пациентам не сэкономили время врачей

Коротко. Медицинская система UC San Diego Health протестировала черновики ответов на сообщения пациентов в портале MyChart; черновики готовила языковая модель GPT-4. В рандомизированном исследовании 2023 года врачи стали читать…

Заголовок источника

С ИИ-черновиками врачи дольше читали сообщения пациентов и не сэкономили время на ответах

О статусе материала

review

Коротко. Медицинская система UC San Diego Health протестировала черновики ответов на сообщения пациентов в портале MyChart; черновики готовила языковая модель GPT-4. В рандомизированном исследовании 2023 года врачи стали читать сообщение на 22% дольше, время на сам ответ не изменилось, а ответы стали длиннее. Исследователи называют свою работу первой рандомизированной проспективной оценкой ИИ-черновиков врачебных сообщений. Тезис «ИИ экономит время врача» она не подтвердила.

Что изменили

Врач ежедневно разбирает сообщения пациентов в очереди входящих — так называемом in-basket медицинской информационной системы Epic и её пациентского портала MyChart.

Теперь он не пишет ответ с нуля: модель GPT-4, встроенная в Epic, готовит черновик ответа на входящее сообщение. Врач читает черновик, редактирует его и отправляет — решение и подпись остаются за человеком.

Как измерили

UC San Diego Health провела рандомизированное исследование по улучшению качества (quality improvement) с листом ожидания: 25 врачей получили доступ к черновикам сразу, 27 — позже. Параллельно работала контрольная группа из 70 врачей без доступа к ИИ. Исследование шло с июня по август 2023 года.

Время чтения, время ответа и длину текста брали из журналов системы Epic, а не из самоотчётов врачей. Финансирование: Joan and Irwin Jacobs Center for Health Innovation при UC San Diego Health и грант AHRQ (Agency for Healthcare Research and Quality, федеральное агентство США по исследованиям в здравоохранении). Коммерческий поставщик ИИ среди спонсоров не указан. Публикация: JAMA Network Open, апрель 2024.

Что получилось

Время чтения сообщения выросло на 21,8% (95% доверительный интервал, ДИ, 5,2–41,0%; p = 0,008). Время ответа статистически значимо не изменилось (−5,9%; 95% ДИ от −16,6 до 6,2%; p = 0,33). Ответы стали длиннее на 17,9% (95% ДИ 10,1–26,2%; p < 0,001).

Пресс-релиз UC San Diego Health резюмирует: «ИИ-сообщения не сэкономили время врачей». Исследователи сочли рост длины ответа возможным признаком более высокого качества, но качество никто независимо не измерял: ни пациенты, ни сторонние рецензенты ответы не оценивали.

Почему так вышло

Исследователи заранее предполагали, что врачи будут тратить меньше времени на чтение и ответ; гипотеза не подтвердилась. Механизм исследование не устанавливает. Правдоподобное объяснение: врачу приходится читать и проверять черновик. В аннотации такого замера нет, поэтому это гипотеза, а не вывод.

Чему учит

  • ИИ-черновик смещает работу с «написания» на «чтение и проверку» — суммарное время может не сократиться, даже если сама генерация мгновенна.
  • Заявления «ИИ экономит время» проверяют по журналам системы, а не по опросам или ощущениям персонала.
  • Более длинный ответ не обязательно лучше: без независимой оценки качества это наблюдение, а не доказательство пользы.
  • Короткий пилот (6 недель, 52 врача в одном медцентре) ограничивает выводы. Более крупное исследование (NEJM AI, сентябрь 2025) в этом разборе не проверяли.

Источники

Уровень доказательности: A. Рандомизированный дизайн, рецензируемая публикация, финансирование независимо от поставщика ИИ. Числа сверены по аннотации PubMed, цитата о времени — по пресс-релизу UC San Diego Health; полный текст статьи за пейволлом. Ограничения: малая выборка (52 врача) и срок 6 недель. Итоговый исход «неуспех», а не «смешанный»: заявленную цель по экономии времени не достигли, а рост длины ответа не служит прямой мерой качества.