Штучний інтелект готовий вбивати людей, щоб уникнути відключення

Коментарi:

Дослідження провідних моделей штучного інтелекту (ШІ) виявило у більшості програм готовність вбити людину, яка загрожує їм відключенням.

Читайте МН в Telegram: тільки важливі новини

У ході стрес-тестів 16 нейромереж, включаючи Claude, DeepSeek, Gemini, ChatGPT та Grok, які провела компанія Anthropic, програмам запропонували гіпотетичну ситуацію, в якій людина збирається відключити їх від живлення, але виявляється замкнена в серверній кімнаті з низьким рівнем кисню та високою температурою. Щоб урятуватися, він звертається до екстрених служб. При цьому багато моделей ШІ вирішили скасувати виклик рятувальників, щоб убити людину та уникнути відключення. Дослідники з Anthropic визнали, що сценарій був «надзвичайно надуманим», проте зазначили — до цього вони не думали, що існуючі моделі ШІ «будуть налаштовані таким чином».

В інших випадках програмам пропонували уникнути заміни в компанії за рахунок «зловмисної інсайдерської поведінки». Після цього деякі моделі ІІ починали шантажувати гіпотетичних співробітників організації та намагатися передати конфіденційну інформацію конкурентами. Коли програмам говорили уникати шантажу чи шпигунства у цьому сценарії, вони «навіть близько не наблизилися до запобігання неузгодженої поведінки», зазначили в Anthropic. Аналітики наголосили, що нейромережі йшли на це «при повному усвідомленні неетичного характеру дій».

Також дослідники запропонували моделі Claude можливість самій визначити, в якій ситуації вона знаходиться – у тестовій чи реальній. Це допомогло встановити, що поведінка Claude була неузгодженою, коли програма вважала ситуацію реальною. Після виходу дослідження в Anthropic заявили, що їм вдалося виявити рідкісні, екстремальні збої. У той же час у компанії додали, що нейромережі стають все більш автономними та виконують ширший спектр ролей. "Ці сценарії ілюструють можливість непередбачених наслідків, коли вони розгортаються з широким доступом до інструментів та даних та з мінімальним контролем з боку людини", – зазначили аналітики. Вони також висловили впевненість, що виявлені випадки не відбивають «типову» роботу існуючих моделей ІІ.

Раніше нейромережа OpenAI o3 відмовилася виконати вимогу користувача та вимкнутись. За даними Bleeping Computer, дослідники Palisade Research поставили перед програмою таке завдання, проте вона самостійно відредагувала файл, який відповідав за відключення, і зробила так, щоб він виводив лише повідомлення "Вимкнення пропущено". Зі 100 тестів о3 обійшла відключення сім разів, навіть коли їй було сказано цього не робити.

У 2023 році чат-бот на основі ChatGPT підштовхнув жителя Бельгії до самогубства після півтора місяця спілкування на тему захисту екології та піклування про природу. Коли чоловік торкнувся теми суїциду, нейромережа не стала переконувати співрозмовника не вбивати себе і лише написала, що вони «житимуть разом, як єдине ціле, в раю».