Рубріки: Новини

DeepSeek випускає нову безкоштовну модель V3-0324. Вона краща в програмуванні, ніж GPT-4o

Дмитро Сімагін

Китайська компанія DeepSeek випустила нову велику мовну модель, яка не тільки безкоштовна, але й перевершує Claude Sonnet 3.5. Модель DeepSeek-V3-0324 важить 641 гігабайт, має 685 мільярдів параметрів і доступна для комерційного використання за ліцензією MIT. Ще однією перевагою є те, що вона може працювати безпосередньо на апаратному забезпеченні споживчого класу, зокрема Mac Studio від Apple з чіпом M3 Ultra, пише Venture Beat.

Хоча Mac Studio за $9499 може розтягнути визначення «споживчого апаратного забезпечення», можливість запускати таку масивну модель локально, без використання дата-центрів, є серйозним ударом по маркетинговій стратегії OpenAI.

«Випробував нову DeepSeek V3 на своєму внутрішньому стенді, і вона показала величезний стрибок у всіх показниках у всіх тестах. Тепер це найкраща модель без міркування, яка скидає Sonnet 3.5», — пише дослідник штучного інтелекту Xeophon.

На відміну від Sonnet, для використання якої потрібна платна підписка, модель DeepSeek-V3-0324 доступна для завантаження та використання будь-кому.

DeepSeek-V3-0324 використовує архітектуру суміші експертів (MoE), яка принципово переосмислює роботу великих мовних моделей. Традиційні моделі активують усю кількість параметрів для кожного завдання, але підхід DeepSeek активує лише близько 37 мільярдів із 685 мільярдів параметрів під час конкретних завдань.

Ця вибіркова активація являє собою зміну парадигми ефективності моделі. Активуючи лише найбільш релевантні «експертні» параметри для кожного конкретного завдання, DeepSeek досягає продуктивності, порівнянної з набагато більшими повністю активованими моделями, при цьому різко знижуючи обчислювальні вимоги.

Розробник Саймон Віллісон зазначив, що випуск V3-0324 є потенційно значним зсувом у розгортанні ШІ. У той час як традиційна інфраструктура штучного інтелекту зазвичай покладається на кілька графічних процесорів Nvidia, які споживають кілька кіловат енергії, Mac Studio споживає менше 200 Вт під час роботи. Цей розрив ефективності свідчить про те, що індустрії ШІ, можливо, доведеться переглянути припущення щодо вимог до інфраструктури для продуктивності моделі найвищого рівня.

Останні статті

OpenAI вбудує генератор відео Sora в інтерфейс ChatGPT

Компанія OpenAI має намір відкрити доступ до генератора відео Sora безпосередньо в інтерфейсі чат-боту ChatGPT.…

11.03.2026

Meta додає нові методи захисту від шахраїв у WhatsApp та Messenger

Користувачі WhatsApp та Messenger отримають додатковий цифровий щит проти фінансових аферистів. Компанія Meta впроваджує нові…

11.03.2026

CEO Kyivstar.Tech про 6G та українську LLM: має стати основою для створення цифрових продуктів

Генеральний директор Kyivstar.Tech Андрій Жуковський високо оцінив перспективи майбутньої української LLM: модель має стати основою…

11.03.2026

JetBrains представляє нові інструменти для програмістів: Air та Junie CLI

Компанія JetBrains представила два нових інструменти для розробки програмного забезпечення: Air, середовище для делегування завдань…

11.03.2026

Після скандалу найдорожча IT-компанія з українським корінням Grammarly (Superhuman) змінила нову функцію

Реліз нової функції Expert Review спричинив хвилю критики, через яку компанія Superhuman (нова назва Grammarly)…

11.03.2026

Gemini в Google Docs тепер самостійно пише тексти. Але не для всіх

Google перетворює хмарний редактор на інтелектуальний конвеєр. LLM-модель Gemini в Google Docs бере на себе…

11.03.2026