Может ли ИИ заменить врача: эксперимент с диагностикой и его ограничения

Может ли ИИ заменить врача: эксперимент с диагностикой и его ограничения

В середине 2025 года Microsoft опубликовала результаты эксперимента с мультиагентной ИИ-системой, выполнявшей задачу диагностики по сложным клиническим случаям. Заголовки многих изданий утверждали, что ИИ «превзошёл врачей». Но то, что реально показал эксперимент, существенно тоньше и требует внимательного прочтения.

Как был устроен тест

Авторы взяли опубликованные сложные клинические случаи из New England Journal of Medicine (NEJM) — это специально подобранные редакцией учебные задачи, предназначенные именно для тренировки диагностического мышления. Они перевели их в последовательный формат: система могла запрашивать дополнительные данные, а оркестрирующий алгоритм распределял задачи между несколькими специализированными моделями. Архитектура учитывала условную «стоимость» запрашиваемых исследований — это добавляло экономическое измерение к диагностическому процессу.

Важно понимать контекст публикации: работа размещена на arxiv как препринт. Это означает, что она не прошла независимое рецензирование в рамках научного журнала на дату выхода материала. Разработчик системы — Microsoft — является и автором исследования. Это не автоматически делает данные недостоверными, но означает, что они не эквивалентны независимой клинической оценке.

Что именно сравнивалось с врачами

Сравнение с людьми — самая часто цитируемая часть результатов и самая часто неверно интерпретируемая. Важны детали: кто именно участвовал в качестве врачей? Какой уровень специализации? Каким информационным инструментам и справочникам они имели доступ в ходе теста — то же ли самое, что у системы? Получили ли они одинаковый с системой интерфейс и структуру задачи?

Эти условия существенно влияют на результат. Врач, работающий в условиях жёсткого ограничения времени без права обратиться к базам знаний, покажет один результат. Врач с полным доступом к справочным ресурсам и временем на размышление — другой. Мультиагентная система, оптимизированная под конкретный формат задачи, находится в иных условиях по определению.

Чем учебный кейс отличается от реального пациента

Случаи NEJM отбирались редакцией именно потому, что они интересны с диагностической точки зрения — это означает нестандартное течение, редкая патология или неочевидная причина. Реальный пациент приходит с неполными данными, плохо описанными симптомами, несколькими сопутствующими заболеваниями, иногда противоречивыми анализами и историей, которую нужно выяснять в разговоре. Текст опубликованного случая — это уже прошедший редактуру нарратив, структурированный для учебных целей.

Перенести точность на тестовом наборе в точность на потоке реальных пациентов — это экстраполяция, требующая отдельного доказательства.

Что ещё нужно проверить перед клиническим применением

Авторы сами называют необходимые следующие шаги. Внешняя валидация: нужна проверка на данных, которые не участвовали в разработке системы, желательно проведённая независимыми группами. Безопасность на разных группах: работает ли система одинаково для пожилых пациентов, людей с нетипичной клинической картиной, редкими заболеваниями? Работа с первичной документацией: реальная история болезни — не то же самое, что структурированный кейс. Влияние на исходы лечения: правильный диагноз на тесте — не то же самое, что улучшение результатов для реальных пациентов. Ответственность и защита данных: кто несёт юридическую ответственность за ошибку системы? Как хранятся и защищаются данные пациентов?

Что результаты действительно означают

Эксперимент показывает, что мультиагентные ИИ-системы могут достигать высокой точности на структурированных диагностических задачах — особенно когда архитектура оптимизирована под конкретный формат и модели выбраны под конкретную задачу. Это заслуживает внимания и дальнейшего изучения. Это не означает, что ИИ уже готов к самостоятельному клиническому применению, и уж тем более не означает, что вводить симптомы в публичный чат-бот является надёжным способом получить диагноз.

Разрыв между результатом лучшей конфигурации в контролируемом эксперименте и готовым клиническим продуктом — большой. Заполнить его призваны независимые исследования, регуляторная проверка и этическая дискуссия о распределении ответственности. Этот путь только начинается.

Где ИИ может помогать врачу

В клинике алгоритм может сортировать документы, подсвечивать отклонения на изображениях, предлагать варианты для проверки или готовить черновик выписки. Но итог зависит от качества входных данных и рабочего процесса. Полезный инструмент встроен в систему контроля, где специалист видит основания рекомендации и может её отклонить.

Фраза «ИИ точнее врача» без описания задачи бессмысленна. Система может хорошо решать узкий тест и плохо работать при другой распространённости болезней, на оборудовании другого производителя или у пациентов, которых почти не было в обучающей выборке.

Риски данных и смещения

Медицинские данные чувствительны. Публичному чат-боту не следует передавать паспортные сведения, полные выписки и изображения, по которым можно установить личность, если сервис не предназначен для медицинской информации и нет законного основания для обработки.

Алгоритм способен воспроизводить смещения выборки: хуже распознавать состояния у недопредставленных групп или предлагать лишние исследования. Поэтому до внедрения нужны внешняя проверка, наблюдение после запуска и понятный порядок сообщения об ошибке.

Как пациенту использовать чат безопаснее

ИИ допустимо попросить объяснить термин простыми словами или составить вопросы к приёму. Затем сведения нужно сверить с официальным источником и врачом. Не используйте ответ для отмены лекарства, выбора дозировки или решения не обращаться за помощью.

При резкой боли, нарушении дыхания, сознания или других признаках неотложного состояния не ведите длинный диалог с системой. Обращайтесь в экстренную службу. Даже корректный текстовый ответ не может осмотреть человека, измерить показатели и организовать помощь.

Читайте также: Может ли ИИ заменить психолога — исследования и граница применения

Главный критерий внедрения — не эффектная демонстрация, а проверяемая польза для пациента при понятной ответственности за ошибку.

Выбор редакции