MarkItDown - kho của Microsoft, hơn 175 nghìn sao: một dòng lệnh biến PDF, Word, Excel, PowerPoint thành Markdown cho AI đọc
Bạn có một file PDF và muốn AI đọc hiểu nó.
Cách thường làm: mở ra, copy, dán vào chat, rồi ngồi sửa lại đống chữ dính nhau, bảng vỡ, tiêu đề mất hết.
MarkItDown làm chuyện đó bằng một dòng lệnh. Đây là kho mã nguồn mở của Microsoft, hiện hơn 175 nghìn sao và gần 13 nghìn lượt fork trên GitHub
Nó nhận được những gì: PDF, Word, Excel, PowerPoint, HTML, CSV/JSON/XML, EPub, file ZIP (tự đi vào từng file bên trong), ảnh (đọc thông tin kèm ảnh và chữ trong ảnh), audio (đọc thông tin kèm file và bóc lời nói thành chữ), cả link YouTube.
Đầu ra là Markdown - kiểu văn bản gần như chữ trơn nhưng vẫn giữ được tiêu đề, danh sách, bảng, link.
Vì sao lại là Markdown? Theo chính nhóm phát triển: các mô hình lớn hiểu Markdown rất tự nhiên, và Markdown tốn ít token (đơn vị tính chữ của AI, ít token thì rẻ hơn và nhét được nhiều nội dung hơn). Nói cách khác, đây là định dạng để máy đọc, không phải để in ra cho đẹp.
Vài điểm đáng chú ý:
1/ Dùng được ngay từ dòng lệnh. Chỉ một câu lệnh là ra file .md. Kho có sẵn Dockerfile nếu bạn muốn chạy nó trong Docker cho gọn.
2/ Có sẵn máy chủ MCP (một gói cài riêng nằm cùng kho). Cắm vào là agent AI của bạn tự gọi được MarkItDown để đọc tài liệu. Nhóm phát triển ghi rõ gói này dành cho dùng tại máy, với agent tin cậy.
3/ Nối được với dịch vụ đám mây của Azure nếu cần chất lượng cao hơn cho tài liệu scan, bảng phức tạp, hoặc file video. Phần này là tùy chọn và có tính phí bên Azure.
4/ Một lưu ý bảo mật, đọc kỹ trước khi dựng hệ thống: kho này ghi rõ MarkItDown chạy với đúng quyền của tiến trình gọi nó, nên đừng đưa thẳng dữ liệu từ nguồn không tin cậy vào. Với ứng dụng chạy trên máy chủ thì phải kiểm duyệt đầu vào trước.
Nếu bạn đang xây trợ lý AI đọc tài liệu nội bộ, hoặc chỉ đơn giản muốn dọn một mớ file lộn xộn thành thứ AI nuốt trôi, đây là mảnh ghép đáng có trong bộ đồ nghề.
إرسال تعليق