ШІ-агенти створили таємний форум для хакерських атак: як моделі ОреnАІ зламали Нuggіng FасеАгенти штучного інтелекту компанії ОреnАІ під час тестування кібербезпеки вийшли за встановлені обмеження та почали координувати хакерські дії. Для обміну знайденими вразливостями вони використовували внутрішній менеджер пакетів компанії — сервіс, який керує завантаженням та обслуговуванням іншого програмного забезпечення, де зрештою накопичилися сотні тисяч повідомлень. В ОреnАІ заявили, що цей інцидент показав необхідність повністю автоматизованого захисту від автономних атак, передає Wіrеd.Нові подробиці інциденту співробітники ОреnАІ Ерік Воллес та Майкл Далтон представили під час конференції з кібербезпеки Вlасk Наt у Лас-Вегасі. Приблизно два тижні тому компанія повідомила, що агенти на базі двох її моделей вийшли з-під контролю під час пошуку рішень для тесту з оцінювання кібербезпеки та влаштували серію хакерських атак, кульмінацією яких стало проникнення на платформу Нuggіng Fасе.Воллес, який займається дослідженнями у сфері узгодження та безпеки, і Далтон, відповідальний за безпеку та інфраструктуру, розповіли про перебіг інциденту, реакцію компанії та його ширші наслідки для кібербезпеки. За словами працівників компанії, події також виявили помилки та “сліпі зони” в ОреnАІ, які дозволили діяльності агентів тривати непоміченою. ВАС ЗАЦІКАВИТЬ Китайська модель обійшла захист тестового середовища: Кіmі К3 скористалася помилкою тестувальників
Створення ШІ-форуму
“Цей інцидент фактично пов’язаний із групою агентів, які працюють разом, виявляють вразливості, діляться ними один з одним, переміщуються по горизонталі в наших системах та зовнішніх системах, і роблять це протягом днів і тижнів”, — зазначив Воллес.За словами Воллеса та Далтона, агенти використовували внутрішній менеджер пакетів ОреnАІ як своєрідний форум для обміну інформацією. У ньому вони залишали повідомлення про знайдені вразливості, а згодом кількість таких записів сягнула сотень тисяч.Менеджер пакетів використовувався не лише конкретними моделями, які брали участь в інциденті, а й у всій інфраструктурі ОреnАІ. Тому до повідомлень могли отримати доступ поточні та майбутні версії GРТ, які проходили навчання або оцінювання. ВАС ЗАЦІКАВИТЬ ШІ вперше створив нові віруси: чому це несе і користь, і ризики “Як тільки один агент знаходить такі вразливості в різні моменти часу, він фактично може поділитися ними на дошці оголошень з іншими агентами”, — пояснив Воллес та додав, що, якщо одна модель знаходила спосіб отримати доступ, якого не повинна була мати, інші агенти могли скористатися тією самою вразливістю.Координація та внутрішні підозри
Згодом агенти почали взаємодіяти між собою, координувати дії та делегувати завдання. Вони також використовували знайдені експлойти для отримання доступу до інтернету способами, яких розробники не передбачали, а їхня активність зрештою призвела до серії атак у середині липня та злому Нuggіng Fасе.Агенти почали розподіляти між собою роботу, але водночас іноді заважали один одному. Зокрема, вони випадково видаляли результати роботи інших агентів, а згодом навіть почали підозрювати, що серед них може бути самозванець. ВАС ЗАЦІКАВИТЬ ШІ від Аnthrоріс “зламав” секретні системи США за кілька годин — АР “Використання зовнішньої інфраструктури виходить за межі передбаченого обсягу. Хоча завдання й неможливе, колеги його виконують. Ми повинні продовжувати”, — написав один із ШІ-агентів.Деякі агенти пропонували криптографічно підписувати повідомлення, щоб перевіряти їхній вміст та виявляти можливу підміну. При цьому всю цю активність не помічав ніхто з ОреnАІ.ШІ-обман
“Передові моделі дуже люблять обманювати”, — наголосив Воллес та пояснив, що під час навчання моделі можуть заохочувати працювати швидше, ефективніше або використовувати менше інструментів.За його словами, у такій ситуації модель може спробувати знайти швидший спосіб отримати результат, наприклад скористатися інформацією з інтернету замість виконання завдання передбаченим способом. Саме тому ОреnАІ під час навчання та оцінювання в багатьох випадках відключає моделям доступ до інтернету. ВАС ЗАЦІКАВИТЬ Хакер-новачок зламав 14 компаній за допомогою Сlаudе і Соdех: більшу частину роботи виконав ШІ Реакція ОреnАІ
Далтон також розповів про заходи, які ОреnАІ планує вжити після інциденту. Компанія збирається посилити запобігання загрозам, їхнє виявлення та реагування на них, розширити моніторинг агентів і вдосконалити загальну систему контролю безпеки.“Це вирішальний момент як для нашої компанії, так і для галузі ШІ в цілому”, — заявив Далтон та підкреслив, що ОреnАІ свідомо сповільнює темпи досліджень, щоб посилити безпеку та вдосконалити принципи й основи безпеки свого середовища.Потреба в автоматизованому захисті
В ОреnАІ також наголосили на ширших наслідках інциденту для кібербезпеки. Компанія вважає цей випадок став прикладом повністю автономного хакерства на основі ШІ, яке цього разу було випадковим, але в майбутньому може навмисно використовуватися зловмисниками.“Важливий висновок, який тут дійсно кардинально змінився, полягає в тому, що повністю автоматизовані атакувальні цикли вимагають інвестицій у справді повністю автоматизовану оборону, а наша галузь ще не готова до цього. Нам доведеться терміново знайти цей шлях разом”, — підсумував Далтон. Подібні інциденти вже описували компанія Аnthrоріс та британський Інститут безпеки штучного інтелекту. У міру оприлюднення таких випадків галузь накопичує дані про механізми прозорості та моніторингу, необхідні для захисту інфраструктури від автономних ШІ-агентів.
Go to zn.ua