Một mô hình chuyển văn bản thành giọng nói mới của Trung Quốc đang thu hút sự chú ý trong cuộc đua AI voice. Đó là Luna-TTS, do VUI Labs phát triển. Trên bảng xếp hạng Speech Arena của Artificial Analysis, Luna-TTS hiện nằm trong nhóm dẫn đầu thế giới, cạnh tranh trực tiếp với những cái tên như Google Gemini, Cartesia, Inworld, MiniMax và ElevenLabs. Bảng xếp hạng này dựa trên đánh giá mù của người dùng, trong đó người nghe so sánh các giọng nói mà không biết mô hình đứng phía sau.
Điểm đáng chú ý của Luna-TTS không chỉ nằm ở việc giọng nói nghe tự nhiên, mà còn ở cách mô hình được xây dựng.

Các hệ thống TTS truyền thống thường tạo giọng nói theo từng bước tuần tự. Cách này có ưu điểm là dễ kiểm soát nhưng có thể tạo ra độ trễ và khiến lỗi tích lũy trong những đoạn nói dài.
Luna-TTS đi theo hướng khác. Theo báo cáo kỹ thuật được công bố trên arXiv, mô hình sử dụng kiến trúc diffusion language model, cho phép tạo nhiều token âm thanh song song thay vì lần lượt từng token. Nhờ đó, mô hình có thể xử lý toàn bộ cấu trúc âm thanh hiệu quả hơn. Điều này đặc biệt quan trọng với những câu dài hoặc nội dung có cách diễn đạt phức tạp.
Luna-TTS cũng được thiết kế để kiểm soát những đặc điểm thường khiến giọng AI trở nên "máy móc", chẳng hạn ngữ điệu, nhịp nói, cảm xúc, hơi thở và các âm thanh phi ngôn ngữ như cười hoặc thở dài.
Nói cách khác, mục tiêu không còn đơn thuần là: Văn bản → đọc thành tiếng
mà là: Văn bản → tạo ra cách nói phù hợp với nội dung.

Luna-TTS tập trung vào chất lượng tổng hợp giọng nói, trong khi Luna-TTS Realtime được thiết kế cho hội thoại trực tiếp.
Phiên bản thời gian thực không tạo toàn bộ câu nói cùng lúc. Nó chia âm thanh thành các khối dài 1,28 giây, sau đó xử lý song song từng khối để giảm độ trễ. Theo báo cáo kỹ thuật, hệ thống đạt tốc độ thời gian thực RTF 0,024 và độ trễ khối đầu tiên 41,6 mili giây trong điều kiện thử nghiệm của nhóm phát triển.
RTF 0,024 có nghĩa là để tạo ra 1 giây âm thanh, hệ thống cần khoảng 0,024 giây xử lý trong điều kiện thử nghiệm đó. Đây là tốc độ cao hơn nhiều so với thời gian thực.
Nếu công nghệ này hoạt động ổn định trong các hệ thống thương mại, nó có thể phù hợp với những ứng dụng cần AI phản hồi bằng giọng nói gần như ngay lập tức, chẳng hạn trợ lý AI, tổng đài tự động, nhân vật ảo và các Voice Agent.
Theo báo cáo kỹ thuật, khả năng sao chép giọng nói và chỉnh sửa âm thanh được tích hợp trực tiếp vào kiến trúc của Luna-TTS. Mô hình được huấn luyện trên khoảng 1 triệu giờ dữ liệu giọng nói, bao gồm tiếng Trung, tiếng Anh, tiếng Nhật và tiếng Hàn.
Nhóm phát triển cũng sử dụng dữ liệu có chú thích về cảm xúc và các âm thanh phi ngôn ngữ để mô hình học cách thể hiện những đặc điểm thường xuất hiện trong giao tiếp của con người.
Trong báo cáo kỹ thuật, VUI Labs cho biết Luna-TTS đạt kết quả tốt nhất trong số các hệ thống được so sánh ở cả bốn chỉ số của bộ đánh giá Seed-TTS-Eval. Mô hình cũng đạt tỷ lệ lỗi thấp trong bài đánh giá CV3-Eval, vốn sử dụng những đoạn thoại phức tạp hơn.
Tuy nhiên, những kết quả này cần được hiểu đúng: đây là kết quả do nhóm phát triển báo cáo trong các bộ benchmark cụ thể, không đồng nghĩa Luna-TTS vượt qua mọi đối thủ ở mọi tiêu chí.
Trên bảng xếp hạng Artificial Analysis, nơi các hệ thống được đánh giá bằng so sánh giọng nói trực tiếp giữa người dùng, Luna-TTS hiện đứng trong nhóm đầu nhưng thứ hạng thay đổi liên tục theo số lượt đánh giá.
Nếu thế hệ TTS trước chủ yếu biến văn bản thành âm thanh, thế hệ mới đang hướng tới việc biến văn bản thành một cách nói hoàn chỉnh. Đó cũng là nền tảng quan trọng để AI chuyển từ những chatbot chỉ biết trả lời bằng chữ sang các trợ lý giọng nói có thể nghe, suy nghĩ và phản hồi gần như theo thời gian thực. Luna-TTS chưa phải mô hình đứng đầu mọi bảng xếp hạng. Nhưng sự xuất hiện của nó cho thấy Trung Quốc đang có thêm một đối thủ đáng chú ý trong cuộc đua xây dựng thế hệ AI giao tiếp bằng giọng nói tự nhiên.
Điểm đáng chú ý của Luna-TTS không chỉ nằm ở việc giọng nói nghe tự nhiên, mà còn ở cách mô hình được xây dựng.
Không chỉ đọc đúng, mà còn biết "nói"

Các hệ thống TTS truyền thống thường tạo giọng nói theo từng bước tuần tự. Cách này có ưu điểm là dễ kiểm soát nhưng có thể tạo ra độ trễ và khiến lỗi tích lũy trong những đoạn nói dài.
Luna-TTS đi theo hướng khác. Theo báo cáo kỹ thuật được công bố trên arXiv, mô hình sử dụng kiến trúc diffusion language model, cho phép tạo nhiều token âm thanh song song thay vì lần lượt từng token. Nhờ đó, mô hình có thể xử lý toàn bộ cấu trúc âm thanh hiệu quả hơn. Điều này đặc biệt quan trọng với những câu dài hoặc nội dung có cách diễn đạt phức tạp.
Luna-TTS cũng được thiết kế để kiểm soát những đặc điểm thường khiến giọng AI trở nên "máy móc", chẳng hạn ngữ điệu, nhịp nói, cảm xúc, hơi thở và các âm thanh phi ngôn ngữ như cười hoặc thở dài.
Nói cách khác, mục tiêu không còn đơn thuần là: Văn bản → đọc thành tiếng
mà là: Văn bản → tạo ra cách nói phù hợp với nội dung.

Từ phòng thu đến hội thoại thời gian thực
VUI Labs phát triển hai phiên bản chính trong dòng Luna-TTS.Luna-TTS tập trung vào chất lượng tổng hợp giọng nói, trong khi Luna-TTS Realtime được thiết kế cho hội thoại trực tiếp.
Phiên bản thời gian thực không tạo toàn bộ câu nói cùng lúc. Nó chia âm thanh thành các khối dài 1,28 giây, sau đó xử lý song song từng khối để giảm độ trễ. Theo báo cáo kỹ thuật, hệ thống đạt tốc độ thời gian thực RTF 0,024 và độ trễ khối đầu tiên 41,6 mili giây trong điều kiện thử nghiệm của nhóm phát triển.
RTF 0,024 có nghĩa là để tạo ra 1 giây âm thanh, hệ thống cần khoảng 0,024 giây xử lý trong điều kiện thử nghiệm đó. Đây là tốc độ cao hơn nhiều so với thời gian thực.
Nếu công nghệ này hoạt động ổn định trong các hệ thống thương mại, nó có thể phù hợp với những ứng dụng cần AI phản hồi bằng giọng nói gần như ngay lập tức, chẳng hạn trợ lý AI, tổng đài tự động, nhân vật ảo và các Voice Agent.
Khả năng sao chép giọng nói
Một điểm đáng chú ý khác của Luna-TTS là zero-shot voice cloning, tức có thể bắt chước giọng nói mà không cần huấn luyện riêng một mô hình cho từng người.Theo báo cáo kỹ thuật, khả năng sao chép giọng nói và chỉnh sửa âm thanh được tích hợp trực tiếp vào kiến trúc của Luna-TTS. Mô hình được huấn luyện trên khoảng 1 triệu giờ dữ liệu giọng nói, bao gồm tiếng Trung, tiếng Anh, tiếng Nhật và tiếng Hàn.
Nhóm phát triển cũng sử dụng dữ liệu có chú thích về cảm xúc và các âm thanh phi ngôn ngữ để mô hình học cách thể hiện những đặc điểm thường xuất hiện trong giao tiếp của con người.
Trong báo cáo kỹ thuật, VUI Labs cho biết Luna-TTS đạt kết quả tốt nhất trong số các hệ thống được so sánh ở cả bốn chỉ số của bộ đánh giá Seed-TTS-Eval. Mô hình cũng đạt tỷ lệ lỗi thấp trong bài đánh giá CV3-Eval, vốn sử dụng những đoạn thoại phức tạp hơn.
Tuy nhiên, những kết quả này cần được hiểu đúng: đây là kết quả do nhóm phát triển báo cáo trong các bộ benchmark cụ thể, không đồng nghĩa Luna-TTS vượt qua mọi đối thủ ở mọi tiêu chí.
Trên bảng xếp hạng Artificial Analysis, nơi các hệ thống được đánh giá bằng so sánh giọng nói trực tiếp giữa người dùng, Luna-TTS hiện đứng trong nhóm đầu nhưng thứ hạng thay đổi liên tục theo số lượt đánh giá.
Cuộc đua TTS đang chuyển sang đâu?
Điều Luna-TTS cho thấy là cuộc đua TTS hiện nay không còn chỉ xoay quanh việc AI phát âm đúng hay không. Các mô hình mới đang cạnh tranh ở ba yếu tố quan trọng hơn: nghe giống người, phản hồi nhanh và thể hiện được cảm xúc.Nếu thế hệ TTS trước chủ yếu biến văn bản thành âm thanh, thế hệ mới đang hướng tới việc biến văn bản thành một cách nói hoàn chỉnh. Đó cũng là nền tảng quan trọng để AI chuyển từ những chatbot chỉ biết trả lời bằng chữ sang các trợ lý giọng nói có thể nghe, suy nghĩ và phản hồi gần như theo thời gian thực. Luna-TTS chưa phải mô hình đứng đầu mọi bảng xếp hạng. Nhưng sự xuất hiện của nó cho thấy Trung Quốc đang có thêm một đối thủ đáng chú ý trong cuộc đua xây dựng thế hệ AI giao tiếp bằng giọng nói tự nhiên.