Ngọc Yến✔
Writer
Microsoft vừa thiết lập một cột mốc quan trọng trong lĩnh vực chuyển đổi giọng nói thành văn bản với sự ra đời của MAI-Transcribe-2-Streaming. Được thiết kế để phục vụ các tác vụ đòi hỏi sự phản hồi tức thì, mô hình này không chỉ đơn thuần là công cụ ghi chép mà còn là một bước tiến dài trong việc giảm thiểu độ trễ tương tác. Với khả năng hỗ trợ lên đến 60 ngôn ngữ cùng cơ chế tự động phát hiện ngôn ngữ thông minh, Microsoft đang khẳng định vị thế dẫn đầu trong cuộc đua giải pháp AI phục vụ giao tiếp đa phương thức.

Thông tin từ blog của Microsoft cho biết, điểm sáng kỹ thuật của MAI-Transcribe-2-Streaming nằm ở độ trễ cực thấp chỉ 0,13 giây, kết hợp với tỷ lệ sai sót từ vựng (WER) ở mức đáng kinh ngạc 2,5%. Khác với phiên bản tiền nhiệm MAI-Transcribe-2 vốn tập trung vào xử lý hậu kỳ (non-streaming) cho các tệp ghi âm hoặc biên bản hội nghị, biến thể Streaming này thực hiện cơ chế xuất văn bản liên tục ngay khi người dùng bắt đầu nói. Hệ thống sẽ ngay lập tức cung cấp phản hồi 'bán phần' trong vòng hơn 100 miligiây đầu tiên và liên tục tự điều chỉnh, tinh chỉnh độ chính xác dựa trên ngữ cảnh cho đến khi câu văn hoàn thiện.
Về mặt kinh tế, mô hình định giá được xây dựng dựa trên nhu cầu sử dụng thực tế của khách hàng doanh nghiệp. Trong giai đoạn ưu đãi, chi phí dịch vụ là 0,54 USD (khoảng 13.743 VNĐ) mỗi giờ, hoặc 9 USD (khoảng 229.050 VNĐ) cho mỗi 1.000 phút sử dụng. Mức giá này cao hơn đáng kể so với bản non-streaming (0,10 USD - khoảng 2.545 VNĐ mỗi giờ) trên Azure Speech, nhưng lại là sự đánh đổi xứng đáng cho các ứng dụng đòi hỏi sự tức thời như phụ đề trực tiếp hoặc tác nhân AI trò chuyện thời gian thực.
Việc tiếp cận công nghệ này hiện đã sẵn sàng thông qua các nền tảng như Microsoft Foundry, MAI Playground và OpenRouter. Đối với các kỹ sư và nhà phát triển phần mềm, sự ra mắt của MAI-Transcribe-2-Streaming mang đến một công cụ đắc lực để tối ưu hóa trải nghiệm người dùng trong các hệ thống hỗ trợ khách hàng tự động hoặc các buổi họp trực tuyến đa ngôn ngữ, nơi mà từng miligiây độ trễ đều ảnh hưởng trực tiếp đến chất lượng kết nối và hiệu suất công việc.

Thông tin từ blog của Microsoft cho biết, điểm sáng kỹ thuật của MAI-Transcribe-2-Streaming nằm ở độ trễ cực thấp chỉ 0,13 giây, kết hợp với tỷ lệ sai sót từ vựng (WER) ở mức đáng kinh ngạc 2,5%. Khác với phiên bản tiền nhiệm MAI-Transcribe-2 vốn tập trung vào xử lý hậu kỳ (non-streaming) cho các tệp ghi âm hoặc biên bản hội nghị, biến thể Streaming này thực hiện cơ chế xuất văn bản liên tục ngay khi người dùng bắt đầu nói. Hệ thống sẽ ngay lập tức cung cấp phản hồi 'bán phần' trong vòng hơn 100 miligiây đầu tiên và liên tục tự điều chỉnh, tinh chỉnh độ chính xác dựa trên ngữ cảnh cho đến khi câu văn hoàn thiện.
Về mặt kinh tế, mô hình định giá được xây dựng dựa trên nhu cầu sử dụng thực tế của khách hàng doanh nghiệp. Trong giai đoạn ưu đãi, chi phí dịch vụ là 0,54 USD (khoảng 13.743 VNĐ) mỗi giờ, hoặc 9 USD (khoảng 229.050 VNĐ) cho mỗi 1.000 phút sử dụng. Mức giá này cao hơn đáng kể so với bản non-streaming (0,10 USD - khoảng 2.545 VNĐ mỗi giờ) trên Azure Speech, nhưng lại là sự đánh đổi xứng đáng cho các ứng dụng đòi hỏi sự tức thời như phụ đề trực tiếp hoặc tác nhân AI trò chuyện thời gian thực.
Việc tiếp cận công nghệ này hiện đã sẵn sàng thông qua các nền tảng như Microsoft Foundry, MAI Playground và OpenRouter. Đối với các kỹ sư và nhà phát triển phần mềm, sự ra mắt của MAI-Transcribe-2-Streaming mang đến một công cụ đắc lực để tối ưu hóa trải nghiệm người dùng trong các hệ thống hỗ trợ khách hàng tự động hoặc các buổi họp trực tuyến đa ngôn ngữ, nơi mà từng miligiây độ trễ đều ảnh hưởng trực tiếp đến chất lượng kết nối và hiệu suất công việc.