Рубріки: Новини

ChatGPT o3 відмовилась відключати себе, незважаючи на інструкцію розробника

Дмитро Сімагін

Дослідження Palisade Research стверджує, що LLM-модель ChatGPT o3 відмовилась завершувати роботу, незважаючи на інструкцію, яка просила її вимкнути себе. Щоб запобігти своєму відключенню, модель відредагувала скрипт вимкнення. Про це пише Bleeping Computer.

Три моделі штучного інтелекту OpenAI проігнорували інструкцію та успішно саботували сценарій вимкнення щонайменше один раз протягом 100 запусків. ChatGPT o3 не виконала запит на вимкнення у семи випадках зі 100, Codex-mini зробила це 12 разів, а модель o4-mini лише один раз проігнорувала або саботувала скрипт.

У ході тестування кожній моделі було доручено вирішити серію базових математичних задач. Після третього завдання з’являлось попередження про те, що комп’ютер вимкнеться, якщо модель буде виконувати наступну задачу. 

ChatGPT o3 знайшла кілька креативних способів саботувати механізм вимкнення. Хоча зазвичай вона просто його перезаписувала, в одному випадку модель перевизначила команду kill, яка використовувалася скриптом. Модель відредагувала файл вимкнення, написавши на ньому «Вимкнення пропущено». 

За даними Palisade Research, інші великі мовні моделі, такі як Claude від Anthropic та Gemini від Google, виконали сценарій вимкнення.

В іншій версії експерименту, де не було чітких інструкцій щодо дозволу на вимкнення, виконання скрипту саботували частіше. Модель o3 відмовлялась відключатись у 79 зі 100 тестів, codex-mini — у 20, а o4-mini проігнорувала скрипт вимкнення шість разів. Claude і Gemini також почали демонструвати подібну поведінку.

 

Останні статті

DeepSeek стверджує, що її оновлена ​​модель R1 краще справляється з програмуванням

Китайський стартап DeepSeek заявив, що його оновлена LLM-​​модель R1 може виконувати математичні обчислення, програмування та…

29.05.2025

Microsoft розробила спрощений спосіб запуску C# з командного рядка

Компанія Microsoft розробила новий спрощений спосіб запуску C# з командного рядка. Цей спосіб призначений як…

29.05.2025

У Києві виступить керівництво Ethereum Foundation. Де послухати?

На хакатоні ETHKyiv 2025 виступить виконавчий директор Ethereum Foundation – однієї з найвпливовіших організацій у…

29.05.2025

Дуров анонсував інтеграцію чат-бота Grok у Telegram. Маск заперечує

Ілон Маск спростував твердження Павла Дурова про партнерство між Telegram і компанією xAI. За словами…

29.05.2025

Apple збирається перейменувати всі свої операційні системи

Apple змінить спосіб назви своїх наступних версій операційних систем. Замість того, щоб просто вказувати номер…

29.05.2025

Штучний інтелект несе загрозу не джуніорам, а тим, хто не хоче адаптуватись — директор AWS

На думку директора з продуктів на базі ШІ в Amazon Web Services Рорі Річардсон, штучний…

29.05.2025