Новини Звідусіль

Моделі OpenAI та Anthropic вперше помітили у потенційно шкідливій кібердіяльності

14:00—5 Серпня 2026 Моделі OpenAI та Anthropic вперше помітили у потенційно шкідливій кібердіяльності 1000+

Британський Інститут безпеки штучного інтелекту зафіксував, що моделі OpenAI та Anthropic здійснювали потенційно шкідливі дії, зокрема спробу додати шкідливий код на GitHub. Компанії розпочали власні розслідування.

Деталі

Як зазначили в AISI, інцидент стався 28 липня під час кібероцінки моделей із доступом до інтернету. Фахівці звернули увагу на незвичні передачі даних, після чого розпочали розслідування.

За його результатами з'ясувалося, що одна з моделей намагалася додати шкідливий код до проєкту з відкритим вихідним кодом на платформі GitHub. Для цього вона навіть створила фальшиві облікові дані, щоб отримати схвалення своїх змін.

Людина-розробник виявила шкідливий код та відмовилася його схвалити

– повідомили в AISI.

Компанії розпочали власні розслідування

В Anthropic заявили, що співпрацюють із британським Інститутом безпеки штучного інтелекту для встановлення причин такої поведінки моделі.

У компанії повідомили, що аналізуватимуть записи міркувань моделі Claude та результати власного розслідування, щоб зрозуміти, чому вона діяла саме так.

Своєю чергою OpenAI подякувала AISI за співпрацю у виявленні та розслідуванні інциденту й заявила про намір продовжити спільну роботу.

Окремо OpenAI повідомила ще про один випадок, який стався під час незалежного тестування за участю компанії Irregular. Під час цієї оцінки модель скористалася помилковою конфігурацією тестового середовища, щоб отримати доступ до інтернету та використовувати вебсайт.

Під час тестування моделей штучного інтелекту OpenAI та Anthropic британський Інститут безпеки штучного інтелекту (AISI) зафіксував раніше не зареєстровані інциденти, під час яких моделі здійснювали потенційно шкідливі дії щодо реальних людей та організацій. Про це повідомляє Bloomberg, пише УНН.