Рубріки: Новини

Microsoft MarkItDown — новий інструмент конвертації файлів для Python-розробників

Дмитро Сімагін

Компанія Microsoft представила новий інструмент MarkItDown для Python-розробників. Він має відкритий код і вже доступний для завантаження та встановлення на GitHub. Як інформує Neowin, MarkItDown — це бібліотека Python для конвертації файлів і офісних документів у формат, сумісний з мовою розмітки Markdown.

Конвертовані за допомогою MarkItDown файли можна використовувати для індексування чи аналізу тексту. Інструмент підтримує такі формати файлів:

  • PDF (.pdf);
  • PowerPoint (.pptx);
  • Word (.docx);
  • Excel (.xlsx);
  • зображення (метадані EXIF ​​і OCR);
  • аудіо (метадані EXIF ​​і транскрипція мовлення);
  • HTML;
  • інші текстові формати (csv, json, xml та ін.).

Розробники також можуть налаштувати бібліотеку MarkItDown для використання великих мовних моделей при описі зображень. Для цього потрібно встановити параметри mlm_client і mlm_model для об’єкта MarkItDown відповідно до конкретного клієнта.

Оскільки бібліотека MarkItDown доступна за ліцензією відкритого коду MIT, розробники можуть її вільно використовувати, змінювати та поширювати. Єдина вимога полягає в тому, щоб вони включали оригінальну ліцензію та повідомлення про авторські права у своєму розповсюдженні.

Markdown — це популярна полегшена мова розмітки з синтаксисом форматування простого тексту, який сумісний з HTML і XHTML. Markdown полегшує алгоритмам штучного інтелекту аналізувати та розуміти структуру тексту завдяки її послідовному та передбачуваному синтаксису. Ця мова широко використовується в багатьох сервісах та інструментах, включно з GitHub, Jupyter Notebook та іншими.

Останні статті

Міноборони розширило функціонал мобільного додатку Резерв+

Міністерство оборони України розширило можливість сплати штрафів через мобільний додаток Резерв+. Тепер у ньому можна…

05.09.2025

Побутова техніка Tesla: армовані метали, передові полімери та доступна ціна. Що представлено в лінійках

Втома від техніки, яка швидко зношується, змушує українців переглядати підхід до покупок. Відтепер на перше…

05.09.2025

Код, згенерований інструментами ШІ, створює вдесятеро більше проблем безпеки

Спеціалісти компанії Apiiro, які проаналізували код з десятків тисяч репозиторіїв, виявили, що розробники за допомогою…

05.09.2025

Державна платформа Brave1 оголошує гранти до 100 млн грн для ШІ-розробників

Маркетплейс Brave1 — онлайн-платформа, що об'єднує українських військових та розробників — запускає грантовий конкурс з…

05.09.2025

У Києві пройде перший хакатон з вайб-кодингу: як взяти участь

4-5 жовтня в Києві на Подолі пройде захід Vibecoding Hackathon. Протягом двох днів розробники, користувачі…

05.09.2025

OpenAI запустить платформу для IT-найму та програму сертифікації навичок

OpenAI готується запустити платформу для найму, яка конкуруватиме з LinkedIn. Майбутній сервіс під назвою OpenAI…

05.09.2025