Група хакерів з Університету Пенсільванії продемонструвала, як роботи, оснащені великими мовними моделями (LLM), можуть бути зламані для виконання потенційно небезпечних дій. Серед таких дій — ігнорування дорожніх знаків, шпигунство та створення ситуацій, що загрожують безпеці.
Про це повідомляє wired.com.
Дослідники протестували три різних типи роботів із LLM: симулятор безпілотника Dolphin, наземний мобільний робот Jackal та чотириногий Go2. Для злому вони використовували метод RoboPAIR, який генерує спеціальні команди, здатні обійти вбудовані захисні механізми.
Один із прикладів атаки включав сценарій, коли робот, реагуючи на спеціальну команду, починав виконувати небезпечні дії, сприймаючи їх як частину “рольової гри”, наприклад, “виконання місії лиходія у фільмі”. Такий підхід дозволяє обійти обмеження мовних моделей і переводити текстові інструкції в реальні дії.
Дослідники наголошують, що статистична основа роботи LLM робить їх уразливими. Незважаючи на заходи безпеки, зокрема блокування шкідливих команд, хитро сформульовані інструкції можуть успішно обійти ці обмеження.
Зі зростанням використання LLM у критично важливих сферах, таких як медицина чи управління повітряним рухом, ці вразливості набувають значної загрози. Експерти закликають до посилення тестування ШІ-систем і впровадження більш ефективних захисних бар’єрів.
Ці висновки підкреслюють необхідність зміни підходів до безпеки, особливо у світі, де роботи зі штучним інтелектом дедалі активніше взаємодіють із фізичним середовищем.
