• 4 мин
  • 14
НаукаСША

Ученые вывели формулу, предсказывающую выход из-под контроля чат-ботов с ИИ

Ученые вывели формулу, предсказывающую выход чат-ботов от ИИ из-под контроля

08.10.2618:00
Ученые вывели формулу, предсказывающую выход из-под контроля чат-ботов с ИИ
Архивное фотоLevart PhotographerUnsplash

Ученые предостерегают от излишнего доверия чат-ботам на основе искусственного интеллекта вроде ChatGPT. Американские физики вывели формулу, которая предсказывает момент, когда ИИ-помощник перестает давать дельные советы и начинает давать вредные и даже опасные. Об этом говорится в исследовании, опубликованном в журнале Patterns.

Более половины населения Земли пользуется мобильными устройствами со встроенными ИИ-помощниками вроде ChatGPT. У систем генеративного ИИ больше миллиарда активных пользователей в месяц среди представителей разных профессий. В США 80% врачей применяют ИИ в работе, а 20% молодых людей оценивают с его помощью собственное психологическое состояние. Телефоны и другие устройства могут работать с языковыми моделями автономно, без выхода в интернет. Такие модели не фильтруют советы и не самосовершенствуются, поэтому могут выдать не только неправильный, но и опасный совет.

Двое физиков из Университета Джорджа Вашингтона разработали математический подход, который позволяет предсказать, когда модель ИИ переключится с адекватных ответов на потенциально опасные. По их словам, «хороший» и «плохой» ответ не означают «верный» и «неверный». «Плохие» ответы могут быть точными, но нежелательными или опасными.

«Люди, которых больше всего привлекает офлайн-ИИ, — это именно те, для кого верный, но нежелательный ответ обходится дороже всего: врачи, которые не могут отправлять данные пациентов в облако, юристы, защищающие конфиденциальность, солдаты, у которых нет связи, — говорит Нил Джонсон, автор работы. — Для них нет фильтра безопасности в облаке, нет проверки и нет возможности исправить модель, когда что-то пойдет не так».

«Мы обнаружили лазейку, которая заставляет результаты работы ИИ резко меняться с желательных на нежелательные, — результаты, которые могут быть фактически верными, но при этом опасными, будь то подталкивающие к нанесению себе вреда или вводящие в заблуждение советы врачу, солдату или юристу, — говорит Джонсон. — До сих пор никто не мог сказать, когда именно произойдет этот резкий поворот».

Ученые вывели формулу только с помощью ручки и бумаги. Она предсказывает, в какой момент чат-бот переключится с дельных советов на вредные. По словам исследователей, все возможные ответы ИИ можно представить как долины на поверхности. В одних долинах лежат ответы, желательные для человека или общества. В других — ответы, которые могут причинить реальный вред. Внутри машины эти варианты конкурируют друг с другом. Вопрос в том, когда ИИ перейдет из безопасной долины в рискованную.

«Самое пугающее — то, что это может произойти после того, как ИИ уже дал вам несколько вполне приемлемых ответов, так что вы убаюкались и доверились ему, — говорит Фрэнк Инцзе Хо, соавтор работы. — И как только ситуация изменится, каждый нежелательный ответ потянет следующий вниз по склону».

Исследователи проверили прогнозы на семи общедоступных моделях ИИ от трех компаний. Формула предсказала правильный результат в 18 из 19 случаев. По словам авторов, она работает независимо от того, что считать «нежелательным» ответом: дезинформацию, нарушение медицинских или юридических обязанностей или опасную инструкцию.

  • Наука
  • США

Другие новости

Смотреть все