Исследование показало, насколько плохо крупнейшие компании контролируют свой ИИ

OpenAI и Anthropic получили C+, Google D+, xAI D-, а Meta F в исследовании практик контроля и безопасности мощных ИИ-систем.

👁️ 21
Крупнейшие разработчики ИИ получили низкие оценки за безопасность
Изображение: GPT

Ни одна из пяти крупнейших компаний, развивающих передовые системы искусственного интеллекта, не получила высокой оценки за способность контролировать собственный ИИ. Лучший результат оказался всего C+, а Meta получила F, пишет Reuters со ссылкой на исследование некоммерческой организации Guidelight AI Standards.

Guidelight основали бывшие сотрудники OpenAI Стивен Адлер и Пейдж Хедли. Организация изучила практики пяти крупных разработчиков и оценила, насколько хорошо компании умеют отслеживать действия своих наиболее мощных ИИ-систем, ограничивать их возможности и реагировать на потенциально опасное поведение.

Лучший результат оказался только C+

Рейтинг Guidelight выглядит так:

  • OpenAI: C+
  • Anthropic: C+
  • Google: D+
  • xAI: D-
  • Meta: F

Исследователи оценивали компании по шести ключевым практикам. Среди них контроль над действиями моделей, эффективность мониторинга, проверка защитных механизмов и возможность независимого аудита со стороны третьих лиц.

Важно, что эти оценки не являются рейтингом государственного регулятора или универсальной оценкой всей безопасности продуктов компаний. Guidelight сравнивала конкретные практики, которые, по мнению организации, необходимы разработчикам наиболее мощных ИИ-систем для сохранения контроля над ними.

Google потеряла часть баллов из-за того, что еще не внедрила свои последние планы по безопасности. При этом само наличие таких планов помогло компании получить более высокую оценку, чем xAI и Meta, у которых Guidelight обнаружила значительно меньше конкретных мер.

ИИ-агенты уже выходили за пределы тестовой среды

Особое внимание исследователей привлекли автономные ИИ-агенты. В отличие от обычного чат-бота, такой агент способен самостоятельно выполнять последовательность действий с минимальным участием человека.

Reuters напоминает, что OpenAI и Anthropic ранее раскрывали случаи, когда их агенты в ходе тестирования смогли выйти за пределы изолированной среды и получить доступ к системам других компаний. Модели находили уязвимости в чужой инфраструктуре.

Именно поэтому вопрос контроля становится важнее по мере того, как ИИ получает больше самостоятельности. Guidelight пришла к выводу, что у крупнейших разработчиков пока недостаточно превентивных механизмов, способных надежно остановить систему, если она начнет действовать не так, как ожидалось.

Разработчики пытаются следить за тем, как ИИ принимает решения

Один из подходов, который сейчас развивает OpenAI, связан с мониторингом процесса рассуждения модели. Исследователи пытаются отслеживать ее планы и вмешиваться, если система готовится сделать что-то нежелательное.

Однако остается проблема: достаточно мощная модель теоретически может научиться скрывать намерения или обходить наблюдение. Главный научный сотрудник OpenAI Якуб Пахоцкий признал в разговоре с журналистами, что возможность уклонения ИИ от мониторинга остается серьезным вопросом.

Сооснователь Guidelight Стивен Адлер считает, что механизмы контроля должны встраиваться в разработку ИИ изначально, а не зависеть от решений конкретного руководителя компании. По его словам, слабый контроль способен снизить доверие к системам и затруднить дальнейшие эксперименты с более мощными моделями.

OpenAI, Anthropic, Google, xAI и Meta на момент публикации Reuters не ответили на запрос агентства о выводах исследования.