Рубріки: Новини

Нова LLM-модель Deepseek v3.1 «краща за Claude Opus 4 і в 68 разів дешевша»

Дмитро Сімагін

Китайський стартап DeepSeek без зайвих анонсів випустив абсолютно нову LLM-модель V3.1. Вона має відкритий код, 685 мільярдів параметрів і довжину контексту до 128k, пише Venture Beat.

Модель досягла 71,6% балів у бенчмарку кодування Aider, зарекомендувавши себе як одна з найпродуктивніших моделей. DeepSeek V3.1 підтримує кілька форматів точності, від стандартного BF16 до експериментального FP8, що дозволяє розробникам оптимізувати продуктивність відповідно до їхніх апаратних обмежень. На цей час V3.1 посідає перше місце серед моделей з відкритим вихідним кодом.

«Deepseek v3.1 набирає 71,6% на aider – non-reasing SOTA. Це «на 1% краще, ніж Claude Opus 4, але в 68 разів дешевше», — написав дослідник штучного інтелекту Ендрю Крістіансон.

Справжній прорив полягає в тому, що DeepSeek називає своєю «гібридною архітектурою». На відміну від попередніх спроб поєднати різні можливості штучного інтелекту, що часто призводило до створення систем, які погано справлялися з усіма завданнями, V3.1 бездоганно інтегрує функції чату, міркування та кодування в єдину, узгоджену модель.

Нагадаємо, що провідний китайський стартап у сфері штучного інтелекту DeepSeek був змушений відкласти випуск своєї майбутньої моделі R2 через труднощі з її навчанням. Проблеми почались після втручання політиків у робочі процес.

Останні статті

Apple інтегрує Claude в середовище розробки Xcode 26

У бета-версії Xcode 26 з'явилася підтримка моделей Claude від компанії Anthropic. Журналісти сайту 9to5Mac з'ясували,…

20.08.2025

Google Docs тепер читає документи вголос за допомогою Gemini

У сервіс Google Docs додали функцію відтворення тексту через віртуального помічника Gemini. Можна вибирати різні…

20.08.2025

Опитування Python-розробників: популярність PyCharm падає, лише 15% використовують останню версію 3.13

Лише 15% Python-розробників використовують останню загальнодоступну версію 3.13. Найпоширенішою версією є 3.12 (35%), яку представили…

20.08.2025

MCP тепер доступний для всіх у Visual Studio

Представлений Anthropic у 2024 році стандарт Model Context Protocol (MCP), який використовується для підключення агентів…

20.08.2025

Кабмін запустить «електронний ТЦК». Яких змін чекати?

Подана на розгляд Програма дій Кабінету Міністрів на 2025–2026 роки містить положення про подальшу цифровізацію…

19.08.2025

Керівник AWS: заміна джунів на штучний інтелект — «одна з найдурніших ідей»

Генеральний директор Amazon Web Services Метт Гарман висловився проти тенденції замінювати співробітників початкового рівня інструментами…

19.08.2025