Рубріки: Новини

Китайська модель DeepSeek V3 з відкритим кодом перевершила усіх конкурентів

Дмитро Сімагін

Китайський стартап DeepSeek створив одну з найпотужніших на сьогоднішній день «відкритих» моделей штучного інтелекту — DeepSeek V3. Вона має відкритий код і навчена на наборі даних з 14,8 трильйонів токенів. 1 мільйон токенів дорівнює приблизно 750 000 слів, повідомляє Venture Beat.

Оскільки модель випущена під відкритою ліцензією, це дозволяє розробникам завантажувати та модифікувати її для більшості програм, включаючи комерційні.

DeepSeek V3 може виконувати низку завдань, у тому числі роботу з кодом, переклад, написання есе та електронних листів.

Відповідно до внутрішнього порівняльного тесту, DeepSeek V3 перевершує як «відкриті», так і «закриті» моделі ШІ, доступ до яких можливий лише через API. У тестах з кодування, які проводяться на платформі Codeforces, DeepSeek V3 перевершила всі інші моделі, зокрема Llama 3.1 405B від Meta, GPT-4o від OpenAI та Qwen 2.5 72B від Alibaba.

DeepSeek V3 також перевершує конкурентів у тесті Aider Polyglot, який розроблено, щоб визначити, чи може модель успішно написати новий код, який інтегрується в існуючий код. 

Відносним недоліком є те, що DeepSeek V3 має величезний розмір: 671 мільярд параметрів. Це приблизно в 1,6 рази більше, ніж розмір моделі Llama 3.1 405B, яка має 405 мільярдів параметрів. DeepSeek V3 знадобиться велика кількість потужних графічних процесорів, щоб відповідати на запитання з розумною швидкістю.

Хоча це не найпрактичніша модель, DeepSeek V3 є досягненням у певному відношенні. Її вдалося навчити за допомогою графічних процесорів Nvidia H800 всього за два місяці. Компанія також стверджує, що витратила лише $5,5 мільйона на навчання DeepSeek V3, що становить незначну частину вартості розробки таких моделей, як GPT-4 від OpenAI.

 

Останні статті

Всюди брехня: розробник програми для обману на співбесідах визнав, що збрехав журналістам про свій дохід

Рой Лі, засновник вірусного стартапу Cluely, визнав, що збрехав журналістам про $7 мільйонів річного доходу.…

06.03.2026

Cursor запускає ще один інструмент агентного кодування — Automations

Популярний ШІ-редактор коду Cursor від компанії Anysphere робить наступний крок у розвитку агентного програмування. Новий…

06.03.2026

Нові функції «Дії»: бронювання працівників у розшуку та податкові знижки

У найближчі місяці в застосунку «Дія» з'явиться кілька нових функцій, в тому числі опція бронювання…

06.03.2026

X запускає новий варіант монетизації: «Ексклюзивні теми» з платним доступом

Соціальна мережа X анонсувала оновлення інструментів монетизації для авторів контенту. Основна зміна полягає в тому,…

06.03.2026

Зарплати українських розробників: наймів більше, але грошей менше

Статистичний аналіз зарплат українських розробників, найнятих на Djinni за три місяці зими, демонструє суперечливі дані.…

06.03.2026

«Вже не можу писати код вручну»: збій в роботі Claude викликав проблеми у деяких розробників

Коли цього тижня стався збій в роботі інструментів вайб-кодування Claude, деяким розробникам програмного забезпечення довелося…

06.03.2026