Chọn giọng đọc, dán văn bản, rồi nhận về file MP3. Mô hình giọng đọc chỉ tải về trình duyệt một lần, mọi bước sau đó chạy ngay trên máy bạn.
Dán một đoạn văn bản, chọn giọng đọc, rồi bấm Tạo giọng đọc — kết quả là một file MP3 bạn có thể nghe thử hoặc tải về. Không có bước nào chạy trên máy chủ: một mô hình giọng đọc nhỏ chạy thẳng trong trình duyệt của bạn, và sau khi tải về một lần, mô hình đó nằm lại trên máy bạn chứ không tải lại nữa.
Cách hoạt động
Việc chuyển văn bản thành giọng nói ở đây gồm ba bước, và cả ba đều chạy trên máy bạn. Đầu tiên, một bộ tách âm vị (phonemizer) phân tích văn bản thành từng âm cụ thể mà giọng đọc cần phát ra — đây là phần giúp công cụ đọc đúng dấu câu, số, và cách phát âm thay vì chỉ đọc từng chữ cái. Tiếp theo, một mạng nơ-ron nhỏ (mô hình giọng đọc) biến các âm đó thành sóng âm thanh, theo từng câu một. Cuối cùng, các đoạn âm thanh được ghép lại và mã hóa thành MP3 để bạn nghe hoặc tải về.
Không bước nào cần đến máy chủ. Cả bộ tách âm vị lẫn mô hình giọng đọc đều chạy qua WebAssembly, trên chính CPU máy bạn, chạy một luồng. Với các đoạn văn thông thường trên máy tính để bàn thì tốc độ này là đủ nhanh; trên điện thoại đời cũ sẽ chậm hơn.
Giọng đọc tiếng Việt hiện có
Hiện tại có một giọng đọc tiếng Việt tên Vais1000 — giọng nữ, chất lượng trung bình khá, phát âm theo cách chuẩn thường gặp trên các bản tin, gần với giọng Hà Nội hơn là giọng Huế hay Sài Gòn. Muốn biết thêm chi tiết về giọng này, xem trang Chuyển văn bản tiếng Việt thành giọng nói.
Mẹo:Muốn nghe rõ chất giọng trước khi dùng cho văn bản dài? Cứ dán một câu ngắn và bấm Tạo giọng đọc — quá trình xử lý chỉ mất vài giây sau khi mô hình đã tải xong.
Tải mô hình về máy và những gì ở lại trên máy bạn
Lần đầu tạo giọng đọc bằng một giọng nào đó, trình duyệt sẽ tải về những gì giọng đó cần: phần lõi WebAssembly dùng chung cho mọi giọng (chỉ phải tải một lần), bộ tách âm vị kèm từ điển phát âm, và bản thân mô hình giọng đọc — tổng cộng khoảng 95 MB với giọng Piper mặc định, hoặc khoảng 119 MB với một giọng Kokoro. Riêng mô hình giọng đọc sau đó được ghi vào bộ nhớ của trình duyệt, và những lần sau đều đọc từ đó ra. Ngày mai quay lại, tất cả những thứ đó đơn giản là không phải tải nữa.
Các file lõi vẫn được trang này phục vụ như mọi tài nguyên web khác, nên để mở được trang thì vẫn cần mạng. Thứ bạn không bao giờ phải trả giá lần thứ hai là mô hình giọng đọc; còn thứ không bao giờ xảy ra là văn bản hay file âm thanh của bạn rời khỏi máy.
Câu hỏi thường gặp
Văn bản của tôi có bị gửi lên máy chủ nào không?
Không. Toàn bộ quá trình — từ việc tách văn bản thành âm vị, chạy mô hình giọng đọc, đến ghép và mã hóa file MP3 — đều diễn ra ngay trên trình duyệt của bạn. Văn bản và file âm thanh không bao giờ rời khỏi máy, và không có gì được ghi lại ở đâu cả.
Vì sao lần dùng đầu tiên phải tải về nhiều dữ liệu như vậy?
Lần đầu tạo giọng đọc, trình duyệt cần tải mọi thứ để có thể xử lý ngay trên máy về sau: khoảng 13,5 MB cho phần lõi WebAssembly chạy mô hình, khoảng 18,8 MB cho bộ tách âm vị kèm từ điển phát âm, và bản thân mô hình giọng đọc. Phần cuối này tùy theo giọng — khoảng 63 MB với một giọng Piper, tổng cộng khoảng 95 MB, hoặc khoảng 86,5 MB với một giọng Kokoro, tổng cộng khoảng 119 MB. Dù chọn giọng nào thì đây cũng là chi phí một lần duy nhất, không phải trả lại ở mỗi lần ghé thăm sau; và khi đã cài Kokoro, mỗi giọng Kokoro về sau chỉ tốn khoảng 0,5 MB.
Lần sau vào lại có phải tải giọng đọc lần nữa không?
Không. Mô hình giọng đọc được lưu thẳng vào bộ nhớ của trình duyệt và những lần sau được đọc từ ổ đĩa máy bạn, không tải lại từ Hugging Face nữa; văn bản và file âm thanh cũng không được gửi đi đâu cả. Tuy vậy, trang web và các file lõi vẫn là tài nguyên web bình thường của trang này, nên bạn vẫn cần mạng để mở được trang: đây là công cụ giữ dữ liệu của bạn ở lại trên máy, không phải một ứng dụng cài đặt để chạy hoàn toàn offline.
Làm sao để xóa một giọng đọc đã tải về?
Mở bảng chọn giọng đọc và bấm nút xóa ngay cạnh giọng bạn muốn gỡ. Giọng đọc sẽ bị xóa khỏi bộ nhớ trình duyệt ngay lập tức, giải phóng dung lượng; bạn có thể tải lại bất cứ lúc nào nếu cần dùng tiếp.
Tôi có thể dùng file giọng đọc này cho mục đích thương mại không?
Điều đó phụ thuộc vào giấy phép của mô hình giọng đọc bạn chọn, không phải vào công cụ này. Mỗi giọng trong bảng chọn đều hiển thị giấy phép của nó — các giọng Piper đi kèm sẵn dùng giấy phép MIT, cho phép sử dụng thương mại, nhưng hãy luôn kiểm tra dòng giấy phép hiển thị cạnh giọng bạn thực sự chọn trước khi dựa vào đó.
Có — mô hình được huấn luyện riêng cho tiếng Việt có dấu nên xử lý cả 6 thanh điệu như một phần cốt lõi, không phải tính năng phụ. Điều kiện quan trọng nhất là văn bản bạn dán vào phải gõ đầy đủ dấu; văn bản tiếng Việt không dấu sẽ khiến giọng đọc không thể đoán đúng thanh điệu và nghe sẽ rất kỳ.