PDF sang Markdown

Biến PDF thành Markdown sạch — ngay trên trình duyệt. Không có gì được tải lên.

File không bao giờ rời khỏi thiết bị của bạn

Thả file PDF vào đây hoặc bấm để chọn

PDF

Công cụ này làm gì

Chuyển PDF sang Markdown đọc lớp văn bản của một PDF và dựng lại thành Markdown sạch — heading, đoạn văn, danh sách dạng gạch đầu dòng và đánh số, link, và định dạng đậm/nghiêng — hoàn toàn ngay trong trình duyệt. Thả một PDF vào, bạn sẽ thấy hai cột song song: Markdown thô một bên, bản xem trước đã dựng ở bên còn lại. Sao chép văn bản hoặc tải về dưới dạng file .md.

Cách công cụ nhận diện cấu trúc

Việc chuyển đổi dựa trên heuristic chứ không phải đoán mò từ văn bản thô — công cụ dùng chính định dạng đã được nhúng sẵn trong PDF:

  • Heading được suy ra từ kích thước phông chữ. Những dòng có phông lớn hơn rõ rệt so với văn bản chính của tài liệu sẽ trở thành heading, với tối đa ba cấp độ tùy mức chênh lệch kích thước.
  • Danh sách được nhận diện qua ký tự mở đầu mỗi dòng. Dòng bắt đầu bằng ký hiệu gạch đầu dòng trở thành danh sách không đánh số; dòng bắt đầu bằng một con số trở thành danh sách đánh số, và giữ đúng số bắt đầu ghi trong PDF (một danh sách bắt đầu từ "5." vẫn giữ số 5 thay vì reset về 1) — sau con số đầu tiên đó, các mục tiếp theo được đánh số tuần tự chứ không đọc lại từng con số in trên mỗi dòng.
  • Link được lấy từ chính các annotation liên kết có sẵn trong PDF, chứ không phải từ việc dò văn bản trông giống một URL, nên một liên kết gắn trên chữ như "tại đây" vẫn được khôi phục đúng.
  • Đậm và nghiêng được nhận diện từ phông chữ dùng cho từng đoạn văn bản (tên phông có chứa Bold, Italic hoặc Oblique), nên định dạng nhấn mạnh trong bản gốc được giữ nguyên khi chuyển sang Markdown.

Tối ưu cho LLM và ghi chú

Kết quả là Markdown sạch, gọn — không kèm định dạng thừa hay style nhúng của PDF — nên rất phù hợp để dán thẳng vào prompt cho LLM, một ứng dụng ghi chú, hoặc một kho tri thức nơi bạn cần cấu trúc (heading, danh sách, link) mà không cần bố cục hình ảnh rườm rà của PDF gốc.

Không có gì bạn thả vào rời khỏi thiết bị

PDF được mở và trích văn bản cục bộ bằng chính bộ xử lý PDF của trình duyệt, rồi Markdown được tạo từ cấu trúc đã trích xuất đó ngay trên thiết bị của bạn. Không có bước tải lên nào — file của bạn không bao giờ rời khỏi tab bạn đang làm việc.

Giới hạn hiện tại

  • Bảng được giữ nguyên dạng văn bản thô, không chuyển thành cú pháp bảng Markdown — đây là mức best-effort hiện tại, việc nhận diện bảng đáng tin cậy hơn có thể là một cải tiến trong tương lai.
  • PDF scan hoặc chỉ chứa ảnh không có lớp văn bản, nên chưa có gì để trình duyệt trích xuất. Công cụ nhận diện trường hợp này và hiển thị cảnh báo; hỗ trợ OCR sẽ có ở một đợt cập nhật sau.
  • Bố cục nhiều cột chỉ được xấp xỉ, chưa xử lý triệt để. Thứ tự đọc hoạt động tốt với tài liệu một cột, nhưng trên những trang nhiều cột phức tạp, các dòng có thể ra sai thứ tự — hiện chưa có cảnh báo riêng cho trường hợp này, nên bạn nên kiểm tra lại kết quả nếu tài liệu có bố cục nhiều cột.

Công cụ liên quan

Cần lấy các trang dưới dạng ảnh thay vì văn bản? PDF sang ảnh xuất mỗi trang thành ảnh JPG hoặc PNG. Muốn tách PDF thành các file riêng trước, thử Tách PDF.

Câu hỏi thường gặp

Công cụ này có chuyển bảng trong PDF thành bảng Markdown không?
Chưa. Bảng được giữ nguyên dạng văn bản thô theo đúng thứ tự đọc gần nhất, thay vì ép thành cú pháp bảng GFM, vì việc nhận diện cột trên PDF thực tế chưa đủ tin cậy và dễ ra bảng sai lệch. Đây là mức best-effort hiện tại.
Có chuyển được PDF dạng scan hoặc ảnh chụp lưu thành PDF không?
Chưa. PDF scan hoặc chỉ chứa ảnh không có lớp văn bản để trình duyệt đọc, nên không có gì để trích xuất — công cụ nhận diện trường hợp này và hiển thị cảnh báo thay vì trả về kết quả rỗng. Hỗ trợ OCR cho tài liệu scan sẽ có ở một đợt cập nhật sau.
Danh sách đánh số có giữ đúng số gốc không?
Đúng một phần. Nếu một danh sách trong PDF bắt đầu từ số 5, kết quả Markdown giữ đúng số bắt đầu đó thay vì đánh số lại từ 1 — nhưng từ đó trở đi, các mục được đánh số tuần tự (6, 7, 8…) chứ không đọc lại từng con số in trên mỗi dòng, nên một danh sách bị bỏ số hoặc đảo số trong bản gốc sẽ không được tái hiện chính xác.
PDF của tôi có bị tải lên đâu để chuyển đổi không?
Không. PDF được đọc và trích văn bản cục bộ bằng chính bộ xử lý PDF của trình duyệt, rồi Markdown được dựng từ đó ngay trên thiết bị của bạn. Không có gì được gửi lên máy chủ — toàn bộ quá trình chuyển đổi diễn ra trong tab bạn đang xem.