Рубріки: Новини

Штучний інтелект поки не може замінити фрілансерів-кодерів, але цей день наближається

Дмитро Сімагін

Дослідники з консалтингової компанії PeopleTec (Алабама, США) вирішили порівняти, як чотири LLM-моделі справляються з роботою фріланс-програмістів. Як виявилось, найкраща модель виконала приблизно 80% завдань з кодування, тоді як досвідчений фрілансер може виконати 96% завдань. Про це повідомляє The Register.

Використовуючи набір даних Kaggle про завдання на платформі Freelancer.com, автори дослідження створили набір із 1115 завдань з програмування та аналізу даних, які можна було оцінити за допомогою автоматизованих тестів. У експерименті взяли участь чотири LLM-моделі: Claude 3.5 Haiku, GPT-4o-mini, Qwen 2.5 та Mistral, перші дві з яких є комерційні моделі, а дві останні – з відкритим вихідним кодом. 

У підсумку модель Claude 3.5 Haiku трохи перевершила GPT-4o-mini. Інші моделі продемонстрували гірші результати.

«Claude розв’язав 877 завдань, усі тести пройшли успішно, що становить 78,7% від бенчмарку — дуже високий бал для такого різноманітного набору завдань. GPT-4o-mini трохи відстала, розв’язавши 862 завдання (77,3%). Qwen 2.5 був третім найкращим, розв’язавши 764 завдання (68,5%). Mistral 7B відставав, розв’язавши 474 завдання (42,5%)».

Незважаючи на те, що моделі штучного інтелекту поки не можуть замінити фрілансерів-кодерів, дослідники впевнені, що цей день незабаром настане. «Я думаю, що це може зайняти місяці», — стверджує Девід Ноевер, головний науковий співробітник PeopleTec.

Одним із цікавих висновків цього дослідження, за словами Ноевера, є те, що моделі з відкритим кодом досягають 30 мільярдів параметрів. «Це якраз на межі можливостей споживчого графічного процесора», — сказав він. «Я думаю, що Codestral, ймовірно, одна з найсильніших [з цих моделей з відкритим кодом], але вона не зможе виконати ці завдання. …Тож, у міру розвитку подій, я думаю, що для цього треба інфраструктура. Просто немає іншого шляху».

Останні статті

Журналістка без досвіду в IT за два дні стала професійним вайб-кодером

Журналістка в якості експерименту провела два дні в офісі IT-компанії Notion, де спробувала себе у…

25.08.2025

Заснована українцями Grammarly збирається конкурувати з ChatGPT. Центром розробки стане Київ

Найбільший єдиноріг з українським корінням, Grammarly, незабаром змінить назву і перетвориться із сервісу перевірки граматики…

25.08.2025

13,4% українських айтівців готуються виїхати за кордон, 20% планують повернутись

48% українських IT-фахівців (у 2024 — 51%) готуються емігрувати або думають про це без наявності…

25.08.2025

Microsoft тестує функцію відновлення роботи Android-додатків у Windows 11

Компанія Microsoft почала тестувати нову функцію Windows 11, яка дозволяє переносити сеанс роботи з Android-програмою…

25.08.2025

Ілон Маск відкрив код Grok 2.5 і пообіцяв зробити те саме з Grok 3

Ілон Маск заявив, що його компанія xAI відкрила код LLM-моделі Grok 2.5. Завантажити її можна…

25.08.2025

CEO Coinbase звільнив програмістів, які не використовували штучний інтелект

Генеральний директор криптовалютної біржі Coinbase Браян Армстронг розповів, що нещодавно звільнив програмістів, які ще не…

22.08.2025