Рубріки: Новини

Новий безкоштовний інструмент Microsoft створює 90-хвилинні подкасти з тексту

Дмитро Сімагін

Компанія Microsoft представила новий проект з відкритим кодом VibeVoice, який перетворює текст на реалістичну мову і здатний генерувати повноцінні подкасти тривалістю до 90 хвилин. Про це повідомляє Windows Central.

На відміну від звичних рішень на базі Copilot, VibeVoice сфокусований виключно на Text-to-Speech (TTS). Користувач вводить текст, а модель перетворює його на аудіофайл з кількома голосами, імітуючи природну розмову.

Система підтримує до чотирьох різних спікерів і зберігає природні паузи і послідовність мови, що відрізняє її від багатьох традиційних TTS-моделей.

Вже є дві версії: з 1,5 млрд параметрів (генерує до 90 хвилин мови з контекстним вікном 64k) і з 7 млрд параметрів (обмеження до 45 хвилин при контексті 32k, але вища якість). У майбутньому з’явиться полегшена версія на 0,5 млрд параметрів, яка розрахована на генерацію стрімів у реальному часі.

Для локального запуску потрібно від 7 до 18 Гб відеопам’яті GPU, однак протестувати VibeVoice можна і онлайн, скориставшись веб-інтерфейсом. Зараз модель навчена працювати лише англійською та китайською мовами, але в майбутньому розробники планують додати нові мови. Вихідний код проекту можна знайти на GitHub та Hugging Face.

У Microsoft зазначають, що система вміє передавати емоції та підтримує багатоголосся, але поки що слабко справляється зі співом. Надалі планується запровадити клонування голосів. Окрім очевидних застосувань для подкастів та відеороликів, технологія може стати цінним інструментом для освітніх сервісів.

Нагадаємо, що днями Microsoft почала тестувати нову функцію Windows 11, яка дозволяє переносити сеанс роботи з Android-програмою на ПК. Поки ця можливість доступна виключно з додатком Spotify і лише для учасників preview-програм у Dev та Beta Channels.

Останні статті

Google запускає локальну версію Gemini

Google оголосила про доступність для клієнтів локальної версії Gemini в рамках пропозиції Google Distributed Cloud…

28.08.2025

В Україні шукають розробників національної LLM. Потрібні 6 фахівців

Українська компанія Kyivstar.Tech відкрила шість вакансій для фахівців, які розроблятимуть національну LLM-модель. Про це повідомили…

28.08.2025

Інструмент кодування Codex став доступним як розширення для VS Code і Cursor

Агентний інструмент кодування Codex від OpenAI, який може виконувати кілька завдань розробки програмного забезпечення паралельно,…

28.08.2025

Зумери не люблять віддалену роботу найбільше за всіх

Працівники покоління Z, народжені в 1997 році і пізніше, не люблять працювати віддалено більше, ніж…

28.08.2025

xAI випустила модель Grok Code Fast 1. Вона оптимізована для розробки і поки безкоштовна

Компанія Ілона Маска xAI випустила велику мовну модель Grok Code Fast 1. Вона має 314…

27.08.2025

Виявлено першу програму-вимагач на базі штучного інтелекту

Дослідники шкідливого програмного забезпечення з компанії ESET Антон Черепанов і Пітер Стричек виявили «перший відомий…

27.08.2025