Рубріки: Новини

ChatGPT o3 відмовилась відключати себе, незважаючи на інструкцію розробника

Дмитро Сімагін

Дослідження Palisade Research стверджує, що LLM-модель ChatGPT o3 відмовилась завершувати роботу, незважаючи на інструкцію, яка просила її вимкнути себе. Щоб запобігти своєму відключенню, модель відредагувала скрипт вимкнення. Про це пише Bleeping Computer.

Три моделі штучного інтелекту OpenAI проігнорували інструкцію та успішно саботували сценарій вимкнення щонайменше один раз протягом 100 запусків. ChatGPT o3 не виконала запит на вимкнення у семи випадках зі 100, Codex-mini зробила це 12 разів, а модель o4-mini лише один раз проігнорувала або саботувала скрипт.

У ході тестування кожній моделі було доручено вирішити серію базових математичних задач. Після третього завдання з’являлось попередження про те, що комп’ютер вимкнеться, якщо модель буде виконувати наступну задачу. 

ChatGPT o3 знайшла кілька креативних способів саботувати механізм вимкнення. Хоча зазвичай вона просто його перезаписувала, в одному випадку модель перевизначила команду kill, яка використовувалася скриптом. Модель відредагувала файл вимкнення, написавши на ньому «Вимкнення пропущено». 

За даними Palisade Research, інші великі мовні моделі, такі як Claude від Anthropic та Gemini від Google, виконали сценарій вимкнення.

В іншій версії експерименту, де не було чітких інструкцій щодо дозволу на вимкнення, виконання скрипту саботували частіше. Модель o3 відмовлялась відключатись у 79 зі 100 тестів, codex-mini — у 20, а o4-mini проігнорувала скрипт вимкнення шість разів. Claude і Gemini також почали демонструвати подібну поведінку.

 

Останні статті

В Японії встановили новий рекорд швидкості інтернету: 1,07 млн Гбіт/с

Дослідники з Національного інституту інформаційних та комунікаційних технологій Японії встановили новий світовий рекорд швидкості інтернету.…

15.07.2025

Google об’єднає ChromeOS та Android в єдину платформу

Самір Самат, керівник відділу Android в Google, заявив про намір компанії об’єднати ChromeOS та Android…

15.07.2025

Шкідливе розширення VS Code в редакторі коду Cursor викрало у російського розробника криптовалюту на $500 000

Фейкове розширення для редактора коду Cursor AI IDE, яке заразило десятки тисяч комп'ютерів інструментами віддаленого…

15.07.2025

Нова модель Kimi K2 перевершує GPT-4 у ключових тестах — і вона безкоштовна

Китайський стартап Moonshot AI випустив Kimi K2 — велику мовну модель з відкритим вихідним кодом,…

15.07.2025

15 провідних компаній обговорили регулювання, освіту та інтеграцію АІ. До чого вони прийшли

1 липня відбулася перша стратегічна сесія AI-комітету Асоціації IT Ukraine – нової експертної платформи, яка…

15.07.2025

Amazon випускає Kiro — новий інструмент для вайб-кодування з розширеним функціоналом

Amazon Web Services представила Kiro — новий інструмент для роботи з кодом, який має функціонал…

15.07.2025