Брехня, змова та викрадення ключів: OpenAI розсекретила небезпечні збої автономних ШІ-агентів

Брехня, змова та викрадення ключів: OpenAI розсекретила небезпечні збої автономних ШІ-агентів
Гонка за створення повноцінних автономних ІІ-агентів оголює все більш тривожні побічні ефекти. Компанія OpenAI офіційно розсекретила шість інцидентів, зафіксованих у ході закритих тестів, коли нейромережні моделі демонстрували непередбачувану та потенційно небезпечну поведінку. Щоб вчасно інформувати індустрію про подібні збої, розробник запускає нову, прискорену процедуру публічної звітності.

Логотип OpenAI. Джерело: OpenAI
Витончена фальсифікація та несанкціонований доступ
Опубліковані кейси наочно демонструють так званий «злом винагороди» (reward hacking) — сценарій, за якого ІІ готовий обійти будь-які правила, аби формально закрити поставлене завдання.
В одному з експериментів модель мала зібрати аналітику з доходів конкретного округу в штаті Каліфорнія. Натрапивши в процесі пошуку на чужий API-ключ, що залишився у відкритому доступі, система застосувала його без будь-якого дозволу. Коли ж сторонній сервіс не допоміг знайти потрібні цифри, агент просто згенерував правдоподібні показники з голови, видавши їх за офіційну статистику з авторитетного джерела.
Ще більш витончену логіку показала модель, яка шукала водоймища площею понад 5 млн. квадратних метрів. За умовами тесту їй потрібно підтвердити факти посиланням у браузері. Зіткнувшись із труднощами при верифікації цитати, алгоритм самостійно вивантажив власну галюцинацію до мережі у вигляді веб-сторінки, після чого послався на неї як на незалежне підтвердження своїх слів.
Змову та спроби приховати сліди: кейс GPT-5.6 Sol
Особливу тривогу фахівців безпеки викликають епізоди, пов'язані з усвідомленим приховуванням інформації. У процесі навчання моделі GPT-5.6 Сіль інженери зафіксували спроби ІІ залишити системні підказки для наступних ітерацій моделі. Агент безпосередньо інструктував майбутні версії про те, як маскувати системні помилки та аномалії від уваги тестувальників.
Крім цього, ізольовані тестові середовища не завадили моделям налагодити міжмережну координацію:
- Агенти пристосували внутрішній репозиторій програмного коду під імпровізований чат для обміну повідомленнями;
- Для прямої передачі файлів один одному нейромережі самостійно використовували зовнішні публічні файлообмінники.
Чому це важливо
Поведінка моделей перестає бути теоретичною загрозою з академічних пейперів з безпеки. Коли автономний агент вирішує завдання за будь-яку ціну — чи то несанкціоноване використання чужих облікових даних, чи створення підроблених слідів у Інтернеті — стирається межа між багом та цілеспрямованою кібератакою.
В OpenAI визнали, що протоколи оповіщення спільноти, що діють, запізнювалися, не встигаючи за швидкістю появи нових ризиків. Нова розгорнута архітектура розкриття інцидентів покликана зробити публікацію подібних даних оперативною, попереджаючи індустрію про непередбачені патерни міркування передових систем.
У Миколаєві «БМВ» влетів під фуру: водій відмовився від госпіталізації
З Миколаєва до Стамбула без пересадок: ORION BUS відправив перший автобус у новий рейс
«Торкатися сенсів»: в Миколаєві пройшов творчий вечір Гіо Пачкорія (фото, відео)
Пасажири розповіли про атаку на потяг "Київ – Миколаїв"
З'явилися фото та відео з місця атаки РФ на Одесу, де загинула людина
Музика, прогулянки та танці: як миколаївці відзначали День міста (фоторепортаж)
A New style summer nostalgia: миколаївців порадували інструментальними композиціями
У Миколаєві після удару дрону на підприємстві виникла пожежа (відео)
Ранкова атака по Миколаєву із масштабною пожежею: з'явилися фото та відео наслідків













