GPT-6.1 Sol vừa đạt 100% trên FrontierMath Tier 4, một trong những nhóm benchmark được thiết kế để kiểm tra năng lực toán học ở mức cực khó. Đây không đơn giản là thêm một điểm benchmark vào bảng thành tích của OpenAI.
Điều đáng chú ý nằm ở tốc độ tiến bộ: chỉ khoảng 10 tháng trước, những bài toán dạng này vẫn được xem là cực kỳ khó đối với các hệ thống AI. Giờ đây, Sol đã đạt mức hoàn thành toàn bộ tập bài được sử dụng trong bài kiểm tra.
Trong khi đó, Astra được ghi nhận giải 5 bài toán Erdős, trong đó 2 bài được hoàn thành trong ngân sách thời gian dự kiến. Điều này cho thấy AI đang bắt đầu được thử nghiệm không chỉ trên benchmark cố định, mà cả những bài toán toán học mang tính nghiên cứu.
Nhưng con số đáng suy nghĩ nhất có thể lại là chi phí. GPT-6.1 Sol được báo cáo có thể đạt hiệu năng gần Astra nhưng với chi phí thấp hơn đáng kể.
Cuộc đua AI vì thế đang thay đổi: không còn chỉ là model nào thông minh hơn, mà là ai có thể biến năng lực suy luận cao thành thứ rẻ hơn, nhanh hơn và có thể triển khai ở quy mô lớn.

Điều đáng chú ý nằm ở tốc độ tiến bộ: chỉ khoảng 10 tháng trước, những bài toán dạng này vẫn được xem là cực kỳ khó đối với các hệ thống AI. Giờ đây, Sol đã đạt mức hoàn thành toàn bộ tập bài được sử dụng trong bài kiểm tra.
Trong khi đó, Astra được ghi nhận giải 5 bài toán Erdős, trong đó 2 bài được hoàn thành trong ngân sách thời gian dự kiến. Điều này cho thấy AI đang bắt đầu được thử nghiệm không chỉ trên benchmark cố định, mà cả những bài toán toán học mang tính nghiên cứu.
Nhưng con số đáng suy nghĩ nhất có thể lại là chi phí. GPT-6.1 Sol được báo cáo có thể đạt hiệu năng gần Astra nhưng với chi phí thấp hơn đáng kể.
Cuộc đua AI vì thế đang thay đổi: không còn chỉ là model nào thông minh hơn, mà là ai có thể biến năng lực suy luận cao thành thứ rẻ hơn, nhanh hơn và có thể triển khai ở quy mô lớn.
