Công cụ này làm gì
Chuyển PDF sang Markdown đọc lớp văn bản của một PDF và dựng lại thành Markdown sạch — heading, đoạn văn, danh sách dạng gạch đầu dòng và đánh số, link, và định dạng đậm/nghiêng — hoàn toàn ngay trong trình duyệt. Thả một PDF vào, bạn sẽ thấy hai cột song song: Markdown thô một bên, bản xem trước đã dựng ở bên còn lại. Sao chép văn bản hoặc tải về dưới dạng file .md.
Cách công cụ nhận diện cấu trúc
Việc chuyển đổi dựa trên heuristic chứ không phải đoán mò từ văn bản thô — công cụ dùng chính định dạng đã được nhúng sẵn trong PDF:
- Heading được suy ra từ kích thước phông chữ. Những dòng có phông lớn hơn rõ rệt so với văn bản chính của tài liệu sẽ trở thành heading, với tối đa ba cấp độ tùy mức chênh lệch kích thước.
- Danh sách được nhận diện qua ký tự mở đầu mỗi dòng. Dòng bắt đầu bằng ký hiệu gạch đầu dòng trở thành danh sách không đánh số; dòng bắt đầu bằng một con số trở thành danh sách đánh số, và giữ đúng số bắt đầu ghi trong PDF (một danh sách bắt đầu từ "5." vẫn giữ số 5 thay vì reset về 1) — sau con số đầu tiên đó, các mục tiếp theo được đánh số tuần tự chứ không đọc lại từng con số in trên mỗi dòng.
- Link được lấy từ chính các annotation liên kết có sẵn trong PDF, chứ không phải từ việc dò văn bản trông giống một URL, nên một liên kết gắn trên chữ như "tại đây" vẫn được khôi phục đúng.
- Đậm và nghiêng được nhận diện từ phông chữ dùng cho từng đoạn văn bản (tên phông có chứa Bold, Italic hoặc Oblique), nên định dạng nhấn mạnh trong bản gốc được giữ nguyên khi chuyển sang Markdown.
Tối ưu cho LLM và ghi chú
Kết quả là Markdown sạch, gọn — không kèm định dạng thừa hay style nhúng của PDF — nên rất phù hợp để dán thẳng vào prompt cho LLM, một ứng dụng ghi chú, hoặc một kho tri thức nơi bạn cần cấu trúc (heading, danh sách, link) mà không cần bố cục hình ảnh rườm rà của PDF gốc.
Không có gì bạn thả vào rời khỏi thiết bị
PDF được mở và trích văn bản cục bộ bằng chính bộ xử lý PDF của trình duyệt, rồi Markdown được tạo từ cấu trúc đã trích xuất đó ngay trên thiết bị của bạn. Không có bước tải lên nào — file của bạn không bao giờ rời khỏi tab bạn đang làm việc.
Giới hạn hiện tại
- Bảng được giữ nguyên dạng văn bản thô, không chuyển thành cú pháp bảng Markdown — đây là mức best-effort hiện tại, việc nhận diện bảng đáng tin cậy hơn có thể là một cải tiến trong tương lai.
- PDF scan hoặc chỉ chứa ảnh không có lớp văn bản, nên chưa có gì để trình duyệt trích xuất. Công cụ nhận diện trường hợp này và hiển thị cảnh báo; hỗ trợ OCR sẽ có ở một đợt cập nhật sau.
- Bố cục nhiều cột chỉ được xấp xỉ, chưa xử lý triệt để. Thứ tự đọc hoạt động tốt với tài liệu một cột, nhưng trên những trang nhiều cột phức tạp, các dòng có thể ra sai thứ tự — hiện chưa có cảnh báo riêng cho trường hợp này, nên bạn nên kiểm tra lại kết quả nếu tài liệu có bố cục nhiều cột.
Công cụ liên quan
Cần lấy các trang dưới dạng ảnh thay vì văn bản? PDF sang ảnh xuất mỗi trang thành ảnh JPG hoặc PNG. Muốn tách PDF thành các file riêng trước, thử Tách PDF.