Рубріки: Новини

Microsoft: не надавайте штучному інтелекту доступ до своєї кредитної картки

Дмитро Сімагін

Компанія Microsoft опублікувала результати випробувань Magentic Marketplace — симуляції торгового майданчика для дослідження можливостей агентів штучного інтелекту. Як виявилось, віртуальним помічникам поки зарано довіряти торгівлю за реальні гроші, пише The Register.

Дослідники Microsoft проводили контрольовані експерименти в різних сценаріях агентного ринку: наприклад, такі транзакції, як замовлення їжі або використання послуг з ремонту житла, де агенти видавали себе за клієнтів та підприємства. 

Кожен експеримент проводився з використанням 100 віртуальних клієнтів та 300 віртуальних підприємств, і включав як власні моделі (такі як GPT-4o та Gemini-2.5-Flash), так і моделі з відкритим кодом. Агенти створювали запити, обробляли результати та узгоджували транзакції.

Результати продемонстрували, що хоча агенти можуть допомогти в роботі, але їхні початкові «достатньо хороші» варіанти часто мають сумнівну ефективність. Штучний інтелект напрочуд легко піддавався на такі маніпуляції, як підроблені посвідчення про нагороди, фальшиві відгуки та приховані промпти. Дослідники також виявили, що деякі моделі демонструють упередженість, зокрема обирають компанію через позицію її сайту в результатах пошуку, а не на основі заслуг.

Однак, моделі відрізнялися між собою. Gemini-2.5-Flash виявилась загалом стійкою, тоді як інших можна було обдурити. 

Підсумовуючи тестування, в Microsoft зазначили: «Ці висновки підкреслюють критичну проблему безпеки для агентських торгових майданчиків». Було доведено, що агенти мають труднощі, коли їм надається забагато варіантів, і є вразливими до маніпуляцій.

Останні статті

Група IT-компаній FRACTAL відкрила безкоштовний доступ до власної системи оцінки кандидатів

Група українських IT-компаній FRACTAL (ex-Netpeak Group) відкрила безкоштовний публічний доступ до власної ШІ-системи психолінгвістичної діагностики…

23.12.2025

ChatGPT отримав нову функцію — «персональні підсумки» року

OpenAI запускає в ChatGPT нову функцію, завдяки якій можна дізнатися, як саме ви взаємодіяли з…

23.12.2025

Microsoft перепише весь свій C та C++ код на Rust вже до 2030 року

Microsoft обіцяє повністю відмовитися від мов програмування C і C ++ до кінця десятиліття. Про…

23.12.2025

Український хакер визнав себе винним у розповсюдженні шкідливого ПЗ Nefilim. За інформацію про його спільника влада США готова заплатити $11 мільйонів

Громадянин України Артем Стрижак у п'ятницю визнав себе винним у здійсненні атак з використанням шкідливого…

22.12.2025

Кожен п’ятий програміст, найнятий Google у цьому році, раніше вже звільнявся з компанії

Близько 20% програмістів, найнятих Google у 2025 році для розробки штучного інтелекту, були так званими…

22.12.2025

Нові комп’ютери почали продавати без оперативної пам’яті

Компанія Paradox Customs, один з найбільших дилерів ПК у штаті Нью-Йорк, оголосила, що додає до…

22.12.2025