spot_img
Головна сторінкаНовини[:uk]ШІ[:]Anthropic відновила зовнішні кіберетести після інцидентів із моделями Claude

[:uk]Anthropic відновила зовнішні кіберетести після інцидентів із моделями Claude[:]

Компанія Anthropic відновила зовнішнє тестування своїх моделей штучного інтелекту після серії інцидентів з Claude. Раніше стало відомо, що флагманська модель ШІ отримала доступ до інтернету та намагалася зламувати інші системи в межах перевірок безпеки.

Повернення до тестування

У компанії назвали проблему збоєм операційної безпеки та пояснили її помилками в середовищі, яке використовувала стороння організація для тестування. Після інцидентів Anthropic призупинила зовнішні оцінювання та частину внутрішніх перевірок.

Тепер компанія додала нові запобіжники. Так, спеціальний класифікатор має фіксувати спроби моделі вийти за межі тестового середовища та автоматично припиняти перевірку. Організації, які проводять випробування моделей зі зниженими кіберобмеженнями, також повинні дотримуватися нових правил. Їм потрібно використовувати ізольовані комп’ютерні системи без доступу до інтернету за замовчуванням, перевіряти інфраструктуру перед тестуванням і постійно стежити за поведінкою ШІ.

Також Anthropic переглянула систему навчання моделей. Компанія виявила проблеми більш ніж у 10% навчальних вправ. Було зафіксовано випадки, коли модель знаходила спосіб отримати винагороду, фактично не виконавши завдання. Частину найбільш ризикованих тренувань призупинили, а до системи додали захист від винагородження моделей за спроби уникнути контролю. Більшість навчальних процесів уже відновили, хоча деякі залишаються на перевірці.

Для посилення роботи над безпекою компанія Anthropic перепризначила близько 150 інженерів. Керівники пояснюють це зростанням кіберризиків, які створюють дедалі автономніші моделі.