Zhipu ra mắt GLM-5.3 - mô hình mã nguồn mở ưu tiên khả năng lập trình

From Beijing with Love
From Beijing with Love
Phản hồi: 0

From Beijing with Love

Cháu đã lớn thế này rồi à. Lại đây chú ôm cái coi.
Zhipu chính thức phát hành GLM-5.3 hôm nay . So với GLM-5.2, mô hình cơ bản vẫn không thay đổi, nhưng sau quá trình huấn luyện…Mở rộng quy mô giúp cải thiện đáng kể giới hạn trên của trí thông minh mô hình: số lượng môi trường thực hiện nhiệm vụ dài hạn nhiều hơn hàng chục lần, nhiều loại môi trường đa dạng hơn và thời gian sau huấn luyện cực kỳ dài.

So với phiên bản tiền nhiệm, GLM-5.3 có những tính năng mới bao gồm:
  • Khả năng lập trình được nâng cao . GLM-5.3 là mô hình mã nguồn mở có khả năng lập trình cao nhất, đạt được sự cải thiện 50% so với GLM-5.2 trong các bài kiểm tra cảm biến chuyển động tích hợp nội bộ và xếp hạng đầu tiên trong số các mô hình mã nguồn mở trong các bài kiểm tra công khai, bao gồm Terminal Bench 3.0 và Agents' Last Exam (CLI).
  • Khả năng an ninh mạng . Trong các tác vụ bảo mật như kiểm tra mã nguồn hộp trắng và phát hiện lỗ hổng, GLM-5.3 hoạt động ngang bằng với Mythos 5, cho thấy tiềm năng mạnh mẽ trong các kịch bản phòng thủ an ninh mạng.
  • Mở rộng quy mô sau huấn luyện . Tất cả những cải tiến trên đều đến từ quá trình sau huấn luyện. Dựa trên IndexShare, SAO và khung Slime thế hệ tiếp theo liên tục được phát triển, Zhipu đã thúc đẩy hiệu quả học tăng cường trên cùng nền tảng với GLM-5.2. Có thể Zhipu vẫn chưa khai thác hết giới hạn trên thông minh của nền tảng này.
  • Mã nguồn mở . Zhipu sẽ công bố trọng số mô hình hai tuần sau khi ra mắt ban đầu, trước đó các đánh giá bảo mật và tăng cường độ an toàn của mô hình sẽ được hoàn tất.
Theo Zhipu, GLM-5.3 hiện là mô hình mã nguồn mở được xếp hạng cao nhất trong một số bài kiểm tra chuẩn phổ biến, với khả năng lập trình và tác nhân gần bằng Claude Fable 5 , và hiệu năng lập trình vượt trội so với các mô hình trong nước khác.
  • Trên Terminal-Bench 3.0, một công cụ đo lường khả năng thực hiện các tác vụ phức tạp của mô hình trong môi trường thiết bị đầu cuối thực tế, điểm số GLM-5.3 đã cải thiện từ 4,6 lên 28,3;
  • Trên DeepSWE v1.1, tập trung vào kỹ thuật phần mềm dài hạn và khả năng chỉnh sửa mã liên tục, điểm số đã cải thiện từ 46,2 lên 66,9;
  • Trong bài kiểm tra cuối cùng của Agents, bao gồm nhiều tình huống chuyên môn thực tế và nhấn mạnh vào sự hợp tác giữa các công cụ cũng như các nhiệm vụ dài hạn, điểm số đã cải thiện từ 23,8 lên 28,5;
  • Với số điểm 1.769 trên GDPval-AA v2, một bài kiểm tra bao gồm 44 ngành nghề và đánh giá các công việc tri thức thực tế, có giá trị cao, nó chứng minh khả năng thực hiện nhiệm vụ chuyên nghiệp dựa trên kỹ năng lập trình.
1786690384649.png
Z.ai Code Bench, được phát triển bởi Zhipu, đánh giá trải nghiệm tổng thể của người dùng đối với các mô hình của nó trong các tình huống lập trình thực tế. Các mô hình được đặt trong môi trường phát triển cục bộ phức tạp và thực hiện các tác vụ từ đầu đến cuối ở các cấp độ tư duy khác nhau, gần giống hơn với trải nghiệm mà các nhà phát triển có được khi thực sự sử dụng một tác nhân lập trình.

Kết quả thử nghiệm cho thấy GLM-5.3 đạt được sự cân bằng tốt hơn giữa hiệu năng và mức độ sử dụng token. Ở thiết lập Cao, GLM-5.3 đạt độ chính xác 31,4%, vượt qua mức cao nhất 29,5% của Claude Opus 4.8. Mỗi tác vụ xuất ra trung bình khoảng 50.000 token, trong khi Opus 4.8 yêu cầu khoảng 120.000 token, điều này có nghĩa là GLM-5.3 có thể hoàn thành các tác vụ với đường dẫn thực thi ngắn hơn.
1786690426044.png
Bắt đầu từ hôm nay, ZCode, công cụ lập trình chính thức của Zhipu, và AutoClaw, một công cụ tăng hiệu quả, đã có sẵn cho tất cả người dùng và mở đăng ký gói GLM Coding Plan.

TraeWork / TraeCode / Button, WorkBuddyCodeBuddyBạn có thể truy cập sớm vào các nền tảng lập trình như Qoder/QwenWork, CatPaw, JoyCode và OpenCode.

API sẽ sớm được ra mắt, và toàn bộ trọng số mô hình sẽ được công khai mã nguồn trong vòng hai tuần . Trước đó, cần phải hoàn tất các biện pháp tăng cường bảo mật cần thiết để hạn chế tối đa khả năng bị tấn công và duy trì giá trị phòng thủ của nó.

Theo thông báo từ Zhipu, vào lúc 13:00 hôm nay, hạn mức tín dụng cho tất cả người dùng Gói Lập trình GLM đã được đặt lại và tất cả người dùng có thể thấy hạn mức tín dụng của họ đã được khôi phục hoàn toàn trong mục "Thống kê sử dụng" trên trang quản trị.
 
Back
Top