Gemini 3.7 Flash vội vàng ra mắt, buộc phải tham gia vào "cuộc chiến giá cả"

Chỉ ba tuần sau khi phát hành Gemini 3.6 Flash, Google đã nhanh chóng cập nhật nó một lần nữa.

Vào ngày 13 tháng 8 theo giờ Mỹ, Google đã phát hành Gemini 3.7 Flash. Bản nâng cấp này tập trung vào lập trình và các tác nhân thông minh.Trong các ứng dụng, phát triển web và các tác vụ đòi hỏi kiến thức phức tạp, Google thậm chí đã chính thức định nghĩa nó là "mẫu hàng đầu dựa trên Flash thông minh nhất từng được sử dụng trong lĩnh vực lập trình và tác nhân thông minh".
1786673344617.png
Ngoài việc tối ưu hóa khả năng của mô hình, Google cũng buộc phải kích hoạt "đòn bẩy giá" để thu hút khách hàng cho các mô hình của mình bằng cách nhấn mạnh tính hiệu quả về chi phí. Đến cuối năm 2026, giá khởi điểm của API Gemini 3.7 Flash sẽ giảm một nửa, xuống còn 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra.

Google hy vọng rằng chiến lược lặp lại tần suất cao và chi phí thấp này sẽ giảm thiểu số lần thử lại và sự can thiệp của con người trong các tác vụ phức tạp, nhiều bước, từ đó giúp các nhà phát triển giảm đáng kể chi phí triển khai trong các tình huống kinh doanh thực tế.

Lập trình, Tác nhân thông minh và Hợp tác đa mô hình​

Gemini 3.7 Flash duy trì những ưu điểm của phương thức nhập liệu đa phương thức trong các thông số kỹ thuật cơ bản, hỗ trợ nhập liệu văn bản, hình ảnh, âm thanh và video, cũng như cửa sổ ngữ cảnh.Giới hạn vẫn giữ nguyên ở mức 1 triệu token, trong khi giới hạn đầu ra được tăng lên 64.000 token.

Mô hình này cũng giới thiệu một cấu hình tư duy có thể điều chỉnh, cho phép người dùng linh hoạt cân bằng chất lượng đầu ra, chi phí suy luận và tốc độ phản hồi trong các nhiệm vụ khác nhau.

Thay đổi quan trọng nhất trong bản nâng cấp này nằm ở cách mô hình xử lý các nhiệm vụ kỹ thuật thực tế.

Google cho biết Gemini 3.7 Flash thể hiện khả năng thích ứng cao hơn khi gặp trở ngại, chủ động làm rõ ý định cho người dùng và thực thi các chỉ dẫn cụ thể một cách chính xác hơn. Đồng thời, bằng cách phân bổ nhiều tài nguyên tính toán hơn cho việc lập kế hoạch nhiều bước và gọi công cụ, nó giảm thiểu nhu cầu thử lại vòng lặp vô hạn và giám sát thủ công trong quy trình làm việc kỹ thuật.

Trong quá trình gỡ lỗi mã thực tế và giải quyết các vấn đề phức tạp, chất lượng tạo mã của Gemini 3.7 Flash đã có một bước tiến vượt bậc so với phiên bản tiền nhiệm, đặc biệt là trong việc xử lý mã lập trình phần mềm dài hạn và mã cấp độ sản xuất, nơi độ chính xác đã được cải thiện đáng kể lần đầu tiên.
1786673396835.png
Trong lĩnh vực phát triển web, mô hình mới này không chỉ có thể tạo ra các trang web đầy đủ chức năng và các ứng dụng phức tạp với ít thao tác hơn, mà còn có thể tái tạo chính xác giao diện người dùng phù hợp với thiết kế dựa trên hệ thống thiết kế, hình ảnh tham khảo, hoặc thậm chí là ảnh chụp màn hình đơn giản.
1786673411579.png
Đối với việc hiểu tài liệu phức tạp và quy trình tự động hóa doanh nghiệp, mô hình mới cũng đạt được bước tiến đáng kể về độ chính xác suy luận. Để chứng minh khả năng ứng dụng thực tiễn của mô hình mới, Google đã giới thiệu một số nghiên cứu trường hợp thực tế thuộc nhiều lĩnh vực khác nhau tại sự kiện ra mắt:

Trường hợp nghiên cứu đầu tiên là tạo ra một trò chơi 3D từ văn bản đơn giản. Các nhà phát triển chỉ cần nhập một đoạn văn bản ngắn, và Gemini 3.7 Flash có thể ngay lập tức xây dựng một khung trò chơi 3D có thể chơi được và làm việc với mô hình Nano Banana để tạo ra các nhân vật, vật phẩm và kết cấu bề mặt trong trò chơi một cách động theo thời gian thực.

Trường hợp thứ hai là tạo ra một trang đích tương tác chỉ trong một bước duy nhất. Gemini 3.7 Flash có thể hoạt động như mô hình chính để điều phối nhiều tác nhân phụ, đồng thời gọi Gemini Omni để tạo ra các thành phần tương tác động với hiệu ứng thị sai, trực tiếp xuất ra một trang web hoạt động.

Trường hợp nghiên cứu thứ ba là huấn luyện robot có hỗ trợ. Trong một vòng lặp đồ thị liên quan đến ba tác nhân, Gemini 3.7 Flash tận dụng khả năng hiểu đa phương thức của mình để giúp robot nhận thức môi trường và đưa ra quyết định, từ đó đẩy nhanh đáng kể tốc độ học tập và huấn luyện của robot.

Trường hợp nghiên cứu thứ tư là việc chuyển đổi các tệp PDF tĩnh thành tệp PDF động. Mô hình có thể trực tiếp đọc một tệp PDF báo cáo thường niên tĩnh phức tạp, tự động phân tích cú pháp và chuyển đổi nó thành một trang web động chứa các biểu đồ thời gian thực, dữ liệu tương tác và tóm tắt các thông tin quan trọng.

Nhà phát triển phần mềm @OmedVibeCodes cho biết mẫu sản phẩm mới đã thể hiện khả năng thu thập chi tiết cực cao trong bài kiểm tra kéo dài 9 phút, cho thấy sự cải tiến đáng kể so với các phiên bản trước đó.

Nhà nghiên cứu bảo mật Florian Roth đã sử dụng chuẩn THOR để kiểm tra hiệu suất của mô hình trong việc phân loại sự cố bảo mật. Trong 189 phát hiện bảo mật thực tế, Gemini 3.7 Flash đạt tỷ lệ phát hiện mối đe dọa 100% và 0% bỏ sót mối đe dọa nghiêm trọng. Quan trọng hơn, nó đã giảm đáng kể các cảnh báo sai, ngăn chặn các nhà phân tích bị quá tải bởi các đánh giá không hiệu quả, khiến nó trở thành mô hình phân loại bảo mật tốt nhất mà ông đã thử nghiệm.

Điểm chuẩn được cải thiện, nhưng chưa phải là lợi thế toàn diện.​

Từ kết quả tổng thể của các bài kiểm tra tiêu chuẩn ngành, những cải tiến của Gemini 3.7 Flash tương đối tập trung, nhưng chưa hoàn toàn vượt trội so với tất cả các đối thủ cạnh tranh.

Trong bài kiểm tra chất lượng mã sản xuất (FrontierCode 1.1 Main), Gemini 3.7 Flash đạt 43,6%, vượt trội hơn Claude Sonnet 5 (42,7%) và GPT-5.6 Terra (41,3%).
1786673481984.png
Trong bài kiểm tra phân tích tài liệu và bảng phức tạp AA-AnalystAgent do tổ chức bên thứ ba Artificial Analysis thực hiện, Gemini 3.7 Flash đã đạt được điểm pass^5 cao nhất là 60%, vượt qua Claude Opus 5 (54%).
1786673508825.png
Trong khi đó, nó đạt được số điểm 62,7% trong bài kiểm tra AutomationBench-AA, vượt trội hơn Kimi K3 (53%) và GPT-5.6 Sol (51,2%).

Tuy nhiên, trong một số môi trường khắc nghiệt, các đối thủ cạnh tranh vẫn duy trì được lợi thế dẫn đầu của mình.

Ví dụ, trong bài kiểm tra kỹ thuật phần mềm dài hạn DeepSWE v1.1 về Phân tích Nhân tạo, tỷ lệ đậu của Gemini 3.7 Flash là 65,3%, thấp hơn so với GPT-5.6 Terra là 69,6%; trong bài kiểm tra mã hóa thiết bị đầu cuối Terminal-bench 2.1, tỷ lệ đậu của nó là 85,8%, thấp hơn một chút so với GPT-5.6 Terra là 87,4%. Tuy nhiên, trong bài kiểm tra đa phương thức trên máy tính để bàn Agent's Last Exam, Claude Sonnet 5 dẫn đầu với tỷ lệ đậu là 33,3% so với 26,3% của Gemini 3.7 Flash.

Dữ liệu đánh giá toàn diện của Artificial Analysis cho thấy Gemini 3.7 Flash đạt chỉ số thông minh 56 điểm ở chế độ suy luận cao, cao hơn 4 điểm so với phiên bản tiền nhiệm và cực kỳ gần với GPT-5.6 Terra (57 điểm). Đồng thời, tốc độ xử lý đạt 340 token mỗi giây, với thời gian hoàn thành nhiệm vụ trung bình chỉ 1,7 phút, nhanh hơn gần 40% so với GPT-5.6 Terra. Khả năng suy luận tốc độ cao này đã giúp nó đạt được vị trí tối ưu Pareto về "trí thông minh và thời gian hoàn thành"..

Trong bài kiểm tra hiệu năng của Arena, được thiết kế cho phát triển web, suy luận toán học và hội thoại nhiều lượt, Gemini 3.7 Flash cũng đạt được bước nhảy vọt đáng kể về thứ hạng.
1786673529941.png
Tuy nhiên, các nhà quan sát bên ngoài như LuminaBench cũng đã chỉ ra rằng hiệu năng của Gemini 3.7 Flash "đáng thất vọng". Họ tin rằng mặc dù đây là một cải tiến so với 3.6 Flash, nhưng nó vẫn thiếu những điểm nổi bật tổng thể và vẫn tụt hậu so với Terra trong nhiều bài kiểm tra hiệu năng. Google cần khẩn cấp Gemini 4 để mang lại hiệu năng thuyết phục hơn; phiên bản hiện tại rõ ràng là không đủ để xoay chuyển tình thế.

Nhìn chung, mô hình mới có định vị rõ ràng: nó hoạt động tốt trong lập trình, phát triển web, hiểu tài liệu và các tác vụ tác nhân thông minh thông thường, nhưng vẫn còn những thiếu sót trong một số mô phỏng môi trường thiết bị đầu cuối phức tạp.

Google buộc phải kích hoạt "đòn bẩy giá cả"​

Bên cạnh việc nâng cao năng lực, chiến lược định giá cũng là một trọng tâm chiến lược khác của thông báo này.

Cho đến ngày 31 tháng 12 năm 2026, Google đang cung cấp cho các nhà phát triển mức giá khuyến mãi cực kỳ hấp dẫn: chỉ 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra. Điều này tương đương với mức giảm giá 50% so với giá tiêu chuẩn ban đầu của Gemini 3.6 Flash.

Đến ngày 1 tháng 1 năm 2027, giá sẽ quay trở lại mức 1,50 đô la cho mỗi triệu token đầu vào và 7,50 đô la cho mỗi triệu token đầu ra. Điều này có nghĩa là Google đang tạo ra một khoảng thời gian giá thấp kéo dài vài tháng cho thị trường.
1786673560029.png
Đối với việc phát triển các tác nhân thông minh tự động, giá thành của một token chỉ là một phần của tổng chi phí. Một nhiệm vụ của tác nhân thông minh trong thế giới thực thường yêu cầu nhiều lần gọi mô hình, thực thi công cụ và thử lại khi xảy ra lỗi. Nếu giá thành của một mô hình rẻ nhưng nó thường xuyên gặp lỗi, khiến chương trình bị kẹt trong vòng lặp thử lại hoặc cần sự can thiệp thủ công, thì tổng chi phí vận hành cuối cùng thực tế sẽ cao hơn.

Việc Google chú trọng vào tỷ lệ thành công ngay lần đầu tiên cao hơn và tuân thủ nghiêm ngặt hơn các lệnh chính là nhằm giải quyết vấn đề khó khăn này.

Theo ước tính chi phí của Artificial Analysis, với mức giá chiết khấu hiện tại, chi phí trung bình cho mỗi tác vụ trên Gemini 3.7 Flash là khoảng 0,40 đô la ở chế độ suy luận cao và giảm xuống còn 0,26 đô la ở chế độ suy luận trung bình.
1786673580694.png
Google đang cố gắng chứng minh rằng bằng cách cải thiện độ tin cậy của các mô hình trong các cơ sở mã và quy trình kinh doanh thực tế, họ có thể giúp các công ty giải quyết hiệu quả các vấn đề then chốt về giảm chi phí và nâng cao hiệu quả.

Lập trình viên @VaibhavSisinty nhận xét rằng Gemini 3.7 Flash rẻ đến mức "chi phí xây dựng một trang web hoàn chỉnh còn thấp hơn giá một tách trà". Với giá chỉ 0,75 đô la cho mỗi triệu token đầu vào, nó thấp hơn tất cả các mô hình hiện tại của Trung Quốc. Theo ông, cuộc chiến giá cả trong lĩnh vực trí tuệ nhân tạo không chỉ sắp xảy ra mà đã đang diễn ra.

Sau khi ra mắt, Gemini 3.7 Flash đã nhanh chóng được tích hợp vào toàn bộ dòng sản phẩm và nền tảng phát triển của Google.

Các nhà phát triển hiện có thể truy cập trực tiếp vào mô hình thông qua API của Gemini và các kênh khác. Khách hàng doanh nghiệp có thể triển khai mô hình thông qua Nền tảng Tác nhân Doanh nghiệp Gemini và nền tảng Doanh nghiệp Gemini. Về phía người dùng cá nhân, người đăng ký Google AI Pro và Ultra có thể trực tiếp trải nghiệm Flash 3.7 trong các tác nhân AI cá nhân của họ, Spark.

Trong khi đó, Google đã cập nhật các quy tắc bảo vệ liên quan đến rủi ro hóa học, sinh học, phóng xạ, hạt nhân và các cuộc tấn công mạng. Tài liệu hướng dẫn về mẫu card đồ họa nêu rõ ngày hết hạn hỗ trợ cho Gemini 3.7 Flash là tháng 3 năm 2026, và nó vẫn giữ nguyên vấn đề ảo ảnh thường gặp trong mô hình cơ bản, có khả năng dẫn đến độ trễ phản hồi hoặc lỗi hết thời gian chờ khi tải cao.

Điều đáng chú ý là bản phát hành này ra mắt chỉ ba tuần sau Gemini 3.6 Flash, và trong bối cảnh việc phát hành Gemini 3.5 Pro cao cấp liên tục bị trì hoãn. Google rõ ràng đang điều chỉnh chiến lược của mình, đẩy nhanh chu kỳ cập nhật của dòng Flash để cho phép mẫu flagship tầm trung của họ dẫn đầu trong việc triển khai lập trình và các tác nhân thông minh.

Tuy nhiên, dù dữ liệu chuẩn rất ấn tượng, bài kiểm tra quan trọng hơn nằm ở việc liệu mô hình có thực sự giảm thiểu sự can thiệp của con người và số lần thử lại sau khi được tích hợp vào một codebase cụ thể, tài liệu nghiệp vụ phức tạp và các quy trình thông minh thực tế, đồng thời duy trì chi phí tổng thể hợp lý cho mỗi tác vụ ngay cả sau khi giai đoạn phục hồi giá kết thúc vào năm tới hay không.
 
Back
Top