← В ленту Новость · 24 августа · 2 мин
Новости

Почему молчание ИИ-агентов невозможно проверить

Фреймворк Why2Speak вскрыл фундаментальный компромисс между точностью решений ИИ и прозрачностью его рассуждений в диалогах. Попытка заставить агента объяснять свое бездействие снижает качество его работы и искажает результаты аудита безопасности. Корпоративным архитекторам придется пересмотреть доверие к стандартным цепочкам логики моделей.

Большинство методик оценки ИИ-агентов исходят из наивного допущения: система обязана выдавать ответ на любой запрос. Однако в реальных корпоративных сценариях умение вовремя промолчать не менее важно, чем способность вступить в диалог. Исследователи Шрея Менди и Бринн Бент из Инженерной школы Пратта при Университете Дьюка представили фреймворк Why2Speak. Его цель — выяснить, действительно ли генерируемые моделью цепочки рассуждений отражают реальную причину вмешательства или бездействия агента. В отличие от стандартных бенчмарков формата вопрос-ответ, работа в реальном времени внутри групповых диалогов сталкивает модели с асимметричной ценой ошибок и сильным дисбалансом классов.

Тестирование гибридной модели Qwen3-8B с использованием прямых стратегий принятия решений, эксплицитных цепочек рассуждений (CoT), обучения с учителем (SFT) и обучения с подкреплением (RL) вскрыло неизбежный компромисс между эффективностью работы и прозрачностью аудита. Прямые алгоритмы принятия решений обеспечили наивысшую точность действий, но вообще не оставили следов для проверки безопасности. Напротив, принудительная генерация рассуждений создавала аудиторский след ценой падения качества: модель резко теряла полноту (recall) и пропускала моменты, когда вмешательство было необходимо. Дообучение с учителем не решило проблему — оно либо подавляло цепочки рассуждений, либо тормозило общую точность. Обучение с подкреплением также дало сбой: групповые целевые функции генерировали нулевой градиент в случаях единодушной, но ошибочной уверенности агента.

Проверка этих цепочек рассуждений с помощью зондирования активаций и поведенческих абляций показала, что стандартные метрики достоверности систематически вводят инженеров в заблуждение. Оценки вероятностей насыщаются при сбоях с высокой степенью уверенности, а зонды активаций остаются уязвимыми к текстовым утечкам и перекосам в распределении классов. Принуждение ИИ-ассистента озвучивать внутренний монолог фундаментально меняет саму стратегию его поведения, а не просто приоткрывает механизм ее работы. Разработчики корпоративных архитектур не могут полагаться на поверхностные цепочки рассуждений, чтобы гарантировать безопасность молчания агента.

Источник arXiv cs.AI → © 2026 «Гад же ты». Полное или частичное копирование — со ссылкой на эту страницу.