Рубріки: Новини

Microsoft MarkItDown — новий інструмент конвертації файлів для Python-розробників

Дмитро Сімагін

Компанія Microsoft представила новий інструмент MarkItDown для Python-розробників. Він має відкритий код і вже доступний для завантаження та встановлення на GitHub. Як інформує Neowin, MarkItDown — це бібліотека Python для конвертації файлів і офісних документів у формат, сумісний з мовою розмітки Markdown.

Конвертовані за допомогою MarkItDown файли можна використовувати для індексування чи аналізу тексту. Інструмент підтримує такі формати файлів:

  • PDF (.pdf);
  • PowerPoint (.pptx);
  • Word (.docx);
  • Excel (.xlsx);
  • зображення (метадані EXIF ​​і OCR);
  • аудіо (метадані EXIF ​​і транскрипція мовлення);
  • HTML;
  • інші текстові формати (csv, json, xml та ін.).

Розробники також можуть налаштувати бібліотеку MarkItDown для використання великих мовних моделей при описі зображень. Для цього потрібно встановити параметри mlm_client і mlm_model для об’єкта MarkItDown відповідно до конкретного клієнта.

Оскільки бібліотека MarkItDown доступна за ліцензією відкритого коду MIT, розробники можуть її вільно використовувати, змінювати та поширювати. Єдина вимога полягає в тому, щоб вони включали оригінальну ліцензію та повідомлення про авторські права у своєму розповсюдженні.

Markdown — це популярна полегшена мова розмітки з синтаксисом форматування простого тексту, який сумісний з HTML і XHTML. Markdown полегшує алгоритмам штучного інтелекту аналізувати та розуміти структуру тексту завдяки її послідовному та передбачуваному синтаксису. Ця мова широко використовується в багатьох сервісах та інструментах, включно з GitHub, Jupyter Notebook та іншими.

Останні статті

Новою СЕО Sigma Software стане Катерина Тулузова

Sigma Software, що є підрозділом Sigma Software Group, заявила про зміну генерального директора. Компанію очолить…

06.06.2025

У Windows 11 з’явиться новий текстовий редактор Edit, легший за Блокнот. Він працюватиме з командного рядка

Microsoft готує додати у Windows 11 новий «легкий» текстовий редактор Edit. Він важить всього 230…

06.06.2025

OpenAI готує до релізу модель o3-pro. Вона найпотужніша для кодування, але коштує $200

Компанія OpenAI у найближчі тижні планує випустити оновлення для тарифного плану ChatGPT Pro, доступ до…

06.06.2025

СЕО знають, що через штучний інтелект будуть звільнення, але всім брешуть — софтверні інвестори

Керівники компаній часто вводять в оману, розповідаючи, що штучний інтелект лише підвищить продуктивність і не…

06.06.2025

США оголосили нагороду в $10 млн за інформацію про українського хакера, який втік у Росію

Уряд США пропонує до $10 мільйонів за інформацію про місцезнаходження розробника шкідливого програмного забезпечення RedLine…

06.06.2025

Google запевняє, що оновлена модель Gemini Pro 2.5 стала краще працювати з кодом

Google оголосила про оновлення своєї LLM-моделі Gemini 2.5 Pro, яка, за твердженням компанії, стала краще…

06.06.2025