Рубріки: Новини

Microsoft MarkItDown — новий інструмент конвертації файлів для Python-розробників

Дмитро Сімагін

Компанія Microsoft представила новий інструмент MarkItDown для Python-розробників. Він має відкритий код і вже доступний для завантаження та встановлення на GitHub. Як інформує Neowin, MarkItDown — це бібліотека Python для конвертації файлів і офісних документів у формат, сумісний з мовою розмітки Markdown.

Конвертовані за допомогою MarkItDown файли можна використовувати для індексування чи аналізу тексту. Інструмент підтримує такі формати файлів:

  • PDF (.pdf);
  • PowerPoint (.pptx);
  • Word (.docx);
  • Excel (.xlsx);
  • зображення (метадані EXIF ​​і OCR);
  • аудіо (метадані EXIF ​​і транскрипція мовлення);
  • HTML;
  • інші текстові формати (csv, json, xml та ін.).

Розробники також можуть налаштувати бібліотеку MarkItDown для використання великих мовних моделей при описі зображень. Для цього потрібно встановити параметри mlm_client і mlm_model для об’єкта MarkItDown відповідно до конкретного клієнта.

Оскільки бібліотека MarkItDown доступна за ліцензією відкритого коду MIT, розробники можуть її вільно використовувати, змінювати та поширювати. Єдина вимога полягає в тому, щоб вони включали оригінальну ліцензію та повідомлення про авторські права у своєму розповсюдженні.

Markdown — це популярна полегшена мова розмітки з синтаксисом форматування простого тексту, який сумісний з HTML і XHTML. Markdown полегшує алгоритмам штучного інтелекту аналізувати та розуміти структуру тексту завдяки її послідовному та передбачуваному синтаксису. Ця мова широко використовується в багатьох сервісах та інструментах, включно з GitHub, Jupyter Notebook та іншими.

Останні статті

Amazon викрила IT-фахівця з КНДР завдяки мілісекундам затримки при натисканні клавіатури

Північнокорейського самозванця, який віддалено працював системним адміністратором в американському Amazon, викрили після того, як затримка…

19.12.2025

В українському IT на третину поменшало початківців

Вітчизняна IT-галузь демонструє ознаки повільного зростання після суттєвого падіння показників у 2022-23 роках. Наприкінці 2025…

19.12.2025

Після обурення спільноти GitHub відмовляється від плану стягувати плату за self-hosted раннери

Не минуло й двох діб після того, як GitHub оголосив про запровадження з 1 березня…

19.12.2025

JetBrains випустила Kotlin 2.3.0. Реліз має експериментальні функції та підтримку Java 25

JetBrains випустила загальнодоступне останнє оновлення мови програмування Kotlin 2.3.0. Новий реліз має низку експериментальних функцій,…

19.12.2025

Нову модель GPT-5.2-Codex від OpenAI названо «найдосконалішим інструментом для реальної розробки»

Компанія OpenAI офіційно представила GPT-5.2-Codex — нову модель, яку названо «найдосконалішим інструментом для реальної розробки…

19.12.2025

Мінфін все ж таки готується ввести ПДВ для ФОП третьої групи

Міністерство фінансів України опублікувало законопроект про введення ПДВ для ФОП 1-3 груп. Прогнозується, що нові…

18.12.2025