Рубріки: Новини

ChatGPT o3 відмовилась відключати себе, незважаючи на інструкцію розробника

Дмитро Сімагін

26.05.2025 11:44

Дослідження Palisade Research стверджує, що LLM-модель ChatGPT o3 відмовилась завершувати роботу, незважаючи на інструкцію, яка просила її вимкнути себе. Щоб запобігти своєму відключенню, модель відредагувала скрипт вимкнення. Про це пише Bleeping Computer.

Три моделі штучного інтелекту OpenAI проігнорували інструкцію та успішно саботували сценарій вимкнення щонайменше один раз протягом 100 запусків. ChatGPT o3 не виконала запит на вимкнення у семи випадках зі 100, Codex-mini зробила це 12 разів, а модель o4-mini лише один раз проігнорувала або саботувала скрипт.

У ході тестування кожній моделі було доручено вирішити серію базових математичних задач. Після третього завдання з’являлось попередження про те, що комп’ютер вимкнеться, якщо модель буде виконувати наступну задачу.

ChatGPT o3 знайшла кілька креативних способів саботувати механізм вимкнення. Хоча зазвичай вона просто його перезаписувала, в одному випадку модель перевизначила команду kill, яка використовувалася скриптом. Модель відредагувала файл вимкнення, написавши на ньому «Вимкнення пропущено».

За даними Palisade Research, інші великі мовні моделі, такі як Claude від Anthropic та Gemini від Google, виконали сценарій вимкнення.

В іншій версії експерименту, де не було чітких інструкцій щодо дозволу на вимкнення, виконання скрипту саботували частіше. Модель o3 відмовлялась відключатись у 79 зі 100 тестів, codex-mini — у 20, а o4-mini проігнорувала скрипт вимкнення шість разів. Claude і Gemini також почали демонструвати подібну поведінку.

Наступна стаття Програмісти Amazon скаржаться, що компанія примушує їх використовувати штучний інтелект »

попередня стаття « Claude 4 скорочує кількість помилок в коді на 25% та прискорює роботу на 40%

Дмитро Сімагін

Теги: ChatGPTLLM-модельopenAI

26.05.2025 11:44

Останні статті

Новини

Sony відмовляється від релізів ігор PlayStation на ПК

Компанія Sony Interactive Entertainment прийняла стратегічне рішення про перегляд свого підходу до портування ексклюзивів, віддаючи…

04.03.2026

Новини

Microsoft хоче стягувати щомісячну плату за використання агентів в офісних програмах

Серед топ-менеджерів великих компаній активно ширяться чутки про те, що Microsoft готує до запуску новий,…

04.03.2026

Новини

Google додає в Android «фішки» Apple: тепер можна ділитися своїм місцезнаходженням в повідомленнях

Компанія Google зробила великий крок назустріч естетиці та функціональності екосистеми Apple, анонсувавши масштабне оновлення Android.…

04.03.2026

Новини

Anthropic запускає голосовий режим для Claude Code

Компанія Anthropic оголосила про поступове розгортання оновлення для Claude Code — інтерфейсу командного рядка (CLI)…

04.03.2026

Новини

Google попереджає про експлойт Coruna: полює на українських користувачів iPhone

Експерти з безпеки Google виявили складний і небезпечний набір експлойтів для зламу пристроїв на базі…

04.03.2026

Новини

OpenAI розробляє власного конкурента GitHub

Компанія OpenAI розробляє власну платформу для програмістів. За повідомленнями інсайдерів, вона має стати прямим конкурентом…

04.03.2026

ChatGPT o3 відмовилась відключати себе, незважаючи на інструкцію розробника

Схожі статті

Останні статті

Sony відмовляється від релізів ігор PlayStation на ПК

Microsoft хоче стягувати щомісячну плату за використання агентів в офісних програмах

Google додає в Android «фішки» Apple: тепер можна ділитися своїм місцезнаходженням в повідомленнях

Anthropic запускає голосовий режим для Claude Code

Google попереджає про експлойт Coruna: полює на українських користувачів iPhone

OpenAI розробляє власного конкурента GitHub