Xiaomi đang công khai cả quá trình huấn luyện AI, có link tại đây

Mr. Darcy
Mr. Darcy
Phản hồi: 0

Mr. Darcy

Editor
Thành viên BQT
1789630492811.png
Xiaomi đang phát trực tiếp quá trình huấn luyện MiMo-V2.6, thế hệ mô hình AI tiếp theo của hãng. Người dùng có thể theo dõi trực tiếp quá trình này tại [đây].

Theo Luo Fuli, người đứng đầu dòng sản phẩm MiMo của Xiaomi, sau khi công khai mã nguồn MiMo-V2.5 vào tháng 4/2026, nhóm phát triển đã dành gần nửa năm tập trung nghiên cứu khả năng mở rộng của học tăng cường (Reinforcement Learning).

MiMo-V2.6 hiện vẫn đang trong quá trình huấn luyện. Xiaomi tập trung mở rộng AI theo ba hướng gồm khả năng tính toán, sử dụng môi trường và công cụ, cùng cơ chế tăng cường sức mạnh tính toán cho chính quá trình đánh giá và chấm điểm mô hình.

Đáng chú ý, chi phí của quá trình huấn luyện được hiển thị trên trang livestream đã vượt 1,25 triệu USD, tương đương khoảng 32,7 tỷ đồng. Xiaomi cho biết MiMo-V2.6 sắp được phát hành và sẽ lần lượt công bố thêm thông tin về quá trình phát triển trong những tuần tới.

Link đây mọi người quan tâm có thể truy cập:


Cách xem như thế nào?
Giữa vô số con số nhảy số liên tục trên dashboard, chúng ta nên quan tâm đến 6 bộ chỉ số sau:

Training cost / Total cost: Đây là chỉ số dễ gây chú ý nhất - Xiaomi đã tiêu bao nhiêu tiền để chạy RL. Nhưng đừng chỉ nhìn tổng tiền, cần xem chi phí tăng nhanh thế nào theo thời gian.
GPU utilization / số GPU đang chạy: Đây mới là con số cho thấy Xiaomi đang thực sự "đốt" bao nhiêu tài nguyên tính toán. Nếu bảng có số GPU, loại GPU và mức sử dụng GPU, nên ghi lại liên tục.
Tokens / Rollout / số token xử lý mỗi bước: Đây là chỉ số mình đặc biệt quan tâm. Xiaomi nói mỗi bước có khoảng 2 tỷ token, 1.568 prompt × 16 lần rollout. Nếu livestream cho thấy tốc độ token/giây hoặc tổng token đã xử lý, có thể tính được quy mô thực tế của quá trình RL.
Reward: Đây có lẽ là chỉ số quan trọng nhất về mặt AI. RL không quan trọng ở chỗ "chạy bao nhiêu GPU" mà ở chỗ sau hàng nghìn bước, reward của mô hình có thực sự tăng hay không. Nếu reward tăng mạnh rồi bắt đầu đi ngang, đó là dấu hiệu rất đáng theo dõi.
Benchmark/evaluation score theo từng checkpoint: Nếu Xiaomi công khai điểm đánh giá trong quá trình huấn luyện, đây sẽ là dữ liệu cực giá trị. Ví dụ checkpoint 1 đạt X, checkpoint 2 đạt Y, checkpoint 3 đạt Z. Khi đó chúng ta mới biết chi phí tính toán tăng thêm có thực sự chuyển thành năng lực AI tốt hơn hay không. (trên trang công khai không có).
Training step và tốc độ hội tụ: Đừng chỉ nhìn "đã train được bao nhiêu". Quan trọng là mỗi bước huấn luyện giúp mô hình tiến bộ bao nhiêu. Nếu càng train lâu mà reward và benchmark gần như không tăng, đó là câu chuyện hoàn toàn khác với việc mô hình liên tục cải thiện.
 
Back
Top