Z.ai, tên quốc tế của Zhipu AI, vừa giới thiệu GLM-5.3, mô hình AI mã nguồn mở mới tập trung mạnh vào lập trình và tác vụ kỹ thuật. Đáng chú ý, trong quá trình huấn luyện, hệ thống được cho là đã hình thành năng lực phân tích lỗ hổng bảo mật nhanh hơn dự kiến của đội ngũ phát triển. Z.ai cho biết model có thể thực hiện quá trình suy luận nhiều bước để xây dựng kế hoạch khai thác một lỗ hổng, thay vì chỉ nhận diện những đoạn mã có vấn đề. Đây là diễn biến đáng chú ý bởi khi AI ngày càng giỏi lập trình, ranh giới giữa công cụ hỗ trợ phát triển phần mềm và công cụ có khả năng phục vụ an ninh mạng cũng trở nên mong manh hơn.
GLM-5.3 được Z.ai giới thiệu với trọng tâm là lập trình, nhưng khả năng phát hiện lỗ hổng bảo mật mới là điểm gây chú ý.
Về nền tảng, GLM-5.3 không phải một model được xây dựng lại hoàn toàn. Z.ai tiếp tục sử dụng kiến trúc Mixture-of-Experts với khoảng 744 tỷ tham số, trong đó khoảng 40 tỷ tham số được kích hoạt cho mỗi token, tương tự GLM-5.2. Phần cải thiện chủ yếu đến từ giai đoạn huấn luyện sau khi model nền đã hoàn thiện. Theo các số liệu do Z.ai công bố, phiên bản mới đạt bước tiến lớn trên nhiều bài kiểm tra dành cho lập trình và tác vụ terminal. Chẳng hạn, điểm Terminal-Bench 3.0 tăng từ 4,6 lên 28,3, trong khi DeepSWE v1.1 tăng từ 46,2 lên 66,9. Những kết quả này cho thấy AI đang chuyển từ việc đơn thuần sinh mã sang khả năng thực hiện chuỗi nhiệm vụ kỹ thuật phức tạp hơn.
Điểm gây chú ý nhất lại nằm ở khả năng an ninh mạng của GLM-5.3. Z.ai cho biết họ đã bổ sung dữ liệu và môi trường huấn luyện liên quan đến phát hiện lỗ hổng, nhưng model sau đó bắt đầu tự hình thành các chiến lược suy luận nhiều giai đoạn để phân tích một chuỗi khai thác. Trên CyberGym, GLM-5.3 đạt 84,5%, cao hơn không đáng kể so với một số model đối thủ trong cùng phép thử. Tuy nhiên, khi chuyển sang ExploitBench, nơi đánh giá khả năng hoàn thành một chuỗi khai thác đầy đủ, model chỉ đạt 54,4%, thấp hơn đáng kể các đối thủ được đem ra so sánh. Điều đó có nghĩa GLM-5.3 hiện rất mạnh ở khâu tìm và xác thực lỗ hổng, nhưng chưa thể xem là một hệ thống tự động hóa tấn công hoàn chỉnh.
Trong quá trình hợp tác với các nhóm an ninh mạng, Z.ai cho biết GLM-5.3 đã hỗ trợ phát hiện hơn 2.400 lỗ hổng trên 269 dự án mã nguồn mở. Một số lỗi được cho là đã tồn tại trong phần mềm trong nhiều thập kỷ. Tuy nhiên, không phải toàn bộ phát hiện đều được công khai ngay lập tức, bởi các dự án liên quan cần có thời gian khắc phục trước khi thông tin kỹ thuật được tiết lộ. Đáng chú ý, Z.ai cũng quyết định chưa mở trọng số GLM-5.3 ngay thời điểm ra mắt như một số phiên bản trước. Công ty dự kiến trì hoãn khoảng hai tuần để đánh giá thêm các rủi ro và hoàn thiện biện pháp an toàn trước khi cộng đồng có thể tự triển khai model.
AI ngày càng có khả năng thực hiện các chuỗi tác vụ kỹ thuật phức tạp, kéo theo yêu cầu kiểm soát chặt chẽ hơn về an toàn.
Sự việc cũng cho thấy một vấn đề lớn hơn của cuộc đua AI lập trình. Khi các mô hình được huấn luyện để hiểu mã nguồn, tìm lỗi và tự thực hiện nhiều bước xử lý, việc chúng phát triển thêm năng lực an ninh mạng ngoài dự kiến có thể không còn là hiện tượng riêng biệt. Z.ai cho biết GLM-5.3 hiện chưa vượt trội ở mọi bài kiểm tra khai thác, nhưng khả năng tiến bộ nhanh trong lĩnh vực này vẫn là tín hiệu đáng chú ý. Khi AI tiếp tục được nâng cấp, các phòng thí nghiệm sẽ phải giải quyết bài toán kép: làm cho model đủ thông minh để hỗ trợ lập trình và bảo mật, đồng thời ngăn chính năng lực đó bị biến thành công cụ phục vụ tấn công mạng.