SpaceXAI (công ty mà nhiều người vẫn quen gọi là xAI) đã chính thức phát hành Grok 4.5 vào ngày 8/7/2026. Phiên bản mới này tập trung vào ba lĩnh vực chính: lập trình (coding), AI Agent và các tác vụ xử lý tri thức (knowledge work).
Theo SpaceXAI, điểm mạnh của Grok 4.5 không nằm ở việc dẫn đầu mọi bảng xếp hạng benchmark. Cursor cho biết hai bên đã cùng hợp tác huấn luyện mô hình trên hàng nghìn tỷ token thu thập từ các tương tác của lập trình viên và AI Agent. Trong khi đó, SpaceXAI nhấn mạnh vào hiệu quả hoàn thành công việc với số lượng token ít hơn, thay vì chỉ tập trung vào điểm benchmark. Các biểu đồ do hãng công bố cũng cho thấy kết quả không hoàn toàn vượt trội ở mọi tiêu chí, mà có những ưu và nhược điểm tùy từng bài đánh giá.
Trong bài viết này, chúng tôi sẽ đối chiếu các tuyên bố của SpaceXAI với những kết quả đánh giá độc lập, đồng thời trực tiếp trải nghiệm Grok 4.5 thông qua API và Cursor để đánh giá hiệu năng thực tế. Bài viết cũng phân tích chi phí sử dụng, các hình thức truy cập và những hạn chế hiện có của mô hình.
Đặc biệt, trọng tâm đánh giá sẽ là chi phí trên mỗi tác vụ hoàn thành (cost per completed task), bởi mức giá tính theo token chỉ phản ánh một phần chi phí thực tế khi các yếu tố như reasoning, thử lại (retry) và gọi công cụ (tool calls) cùng tham gia vào quá trình xử lý.
Grok 4.5 là gì?
Grok 4.5 là mô hình AI Mixture-of-Experts (MoE) độc quyền của SpaceXAI, được thiết kế với trọng tâm là khả năng suy luận (reasoning). Theo SpaceXAI, mô hình này hướng đến các tác vụ như lập trình (coding), AI Agent và công việc văn phòng, xử lý tri thức.
Tên gọi “Grok” thực tế có thể đề cập đến ba thành phần khác nhau. Chúng có liên quan với nhau nhưng không thể sử dụng thay thế cho nhau:
- grok-4.5: Mô hình AI nền tảng, được truy cập thông qua API.
- Grok: Trợ lý AI dành cho người dùng cuối, hoạt động trên grok.com và nền tảng X.
- Grok Build: Môi trường lập trình và AI Agent của SpaceXAI, trong đó Grok 4.5 hiện được sử dụng làm mô hình mặc định.
Trong bài viết này, thuật ngữ “Grok 4.5” sẽ được dùng để chỉ mô hình AI, trừ khi đề cập cụ thể đến một sản phẩm của SpaceXAI.
Những điểm nổi bật của Grok 4.5
- Cửa sổ ngữ cảnh (Context Window): lên tới 500.000 token, cho phép xử lý các tài liệu và đoạn hội thoại rất dài.
- Mức độ suy luận (Reasoning Effort): có thể tùy chỉnh theo ba cấp độ Low, Medium và High, trong đó High là mức mặc định.
- Mốc kiến thức (Knowledge Cutoff): cập nhật dữ liệu đến ngày 01/02/2026.
- Đầu vào (Input): hỗ trợ văn bản và hình ảnh.
- Đầu ra (Output): chỉ tạo văn bản; không hỗ trợ sinh ảnh. Đối với nhu cầu tạo hình ảnh, SpaceXAI cung cấp các mô hình AI chuyên biệt riêng.
Có gì mới trên Grok 4.5?
SpaceXAI chia các điểm nâng cấp của Grok 4.5 thành bốn nhóm chính: lập trình với AI Agent, tối ưu số lượng token sử dụng, hỗ trợ công việc văn phòng và khả năng sử dụng công cụ (tool support). Khái niệm “agent task” khá rộng, vì vậy điều quan trọng là xem mô hình thực sự có thể làm gì, thay vì chỉ dựa vào tên gọi.
Lập trình và AI Agent
Trong một tác vụ lập trình sử dụng AI Agent, Grok 4.5 không chỉ trả lời câu hỏi về mã nguồn mà còn có thể:
- Phân tích toàn bộ kho mã nguồn (repository).
- Lập kế hoạch sửa đổi.
- Chỉnh sửa nhiều tệp tin.
- Thực thi các lệnh trên môi trường phát triển.
- Chạy kiểm thử (test).
- Tự thử lại (retry) khi gặp lỗi.
Điều này khác biệt đáng kể so với việc chỉ trả lời một câu hỏi lập trình đơn lẻ.
Để chứng minh năng lực này, SpaceXAI đã sử dụng 4 bộ benchmark kỹ thuật phần mềm làm cơ sở đánh giá.
Tốc độ xử lý và hiệu quả sử dụng token
Theo SpaceXAI, Grok 4.5 có tốc độ sinh nội dung khoảng 80 token/giây, đồng thời tiêu thụ ít token hơn so với một số mô hình AI khác khi hoàn thành cùng một nhiệm vụ.
Ví dụ, trên bài kiểm tra SWE-Bench Pro, Grok 4.5 chỉ cần khoảng 15.954 token đầu ra để giải quyết một tác vụ, trong khi Claude Opus 4.8 (Max Mode) cần tới 67.020 token.
Điều này cho thấy SpaceXAI không chỉ tập trung vào chi phí theo mỗi triệu token, mà còn hướng đến chi phí thực tế để hoàn thành một công việc (cost per completed task).
Hỗ trợ công việc văn phòng và xử lý tri thức
SpaceXAI cho biết Grok 4.5 có thể hỗ trợ nhiều tác vụ văn phòng như:
- Nghiên cứu thông tin.
- Soạn thảo tài liệu ra quyết định.
- Phân tích bảng tính Excel.
- Tạo và chỉnh sửa bài thuyết trình.
Các ví dụ mà hãng công bố chủ yếu sử dụng Office Add-ins. Tuy nhiên, những bản trình diễn này không đủ để chứng minh tỷ lệ thành công trong thực tế.
Tác giả bài đánh giá cũng đã trực tiếp thử nghiệm một tác vụ văn phòng bằng API của Grok 4.5.
Ngoài ra, kết quả đánh giá ban đầu từ Snorkel AI trên bộ benchmark GDPval+ cho thấy:
- Grok 4.5: tỷ lệ hoàn thành thành công trung bình 29%
- GPT-5.5: 22%
- Claude Opus 4.8: 21%
GDPval+ bao gồm khoảng 2.000 tác vụ mô phỏng công việc chuyên môn. Cần lưu ý rằng tỷ lệ trên chỉ phản ánh kết quả đối với bộ dữ liệu và phương pháp chấm điểm này, không đồng nghĩa Grok 4.5 sẽ đạt tỷ lệ tương tự trên mọi bảng tính, báo cáo hay bài thuyết trình.
Bài thử nghiệm thông qua API của tác giả cũng là một phép đánh giá độc lập, không thuộc benchmark GDPval+.
Công cụ và tính năng API
Grok 4.5 hỗ trợ nhiều tính năng quan trọng dành cho nhà phát triển, bao gồm:
- Function Calling (gọi hàm)
- Structured Outputs (xuất dữ liệu có cấu trúc)
- Tìm kiếm trên Web và nền tảng X
- Thực thi mã nguồn (Code Execution)
- Tìm kiếm tài liệu thông qua Collections
- Context Compaction giúp tối ưu các phiên làm việc dài
Những khả năng này cho phép ứng dụng không chỉ tạo văn bản mà còn có thể:
- Tra cứu thông tin theo thời gian thực.
- Thực thi mã nguồn.
- Kiểm tra kết quả.
- Tương tác với các công cụ bên ngoài.
Context Compaction là gì?
Context Compaction là cơ chế tự động rút gọn phần lịch sử hội thoại cũ trước khi gửi yêu cầu mới.
Nhờ đó:
- Phiên làm việc có thể tiếp tục trong thời gian dài mà không phải gửi lại toàn bộ lịch sử.
- Giảm lượng token sử dụng.
Tuy nhiên, quá trình rút gọn này có thể làm mất một số chi tiết, và mô hình vẫn phải tuân theo giới hạn 500.000 token của cửa sổ ngữ cảnh.
Grok 4.5 được huấn luyện như thế nào?
Nếu bạn chỉ quan tâm đến hiệu năng hoặc mức giá, có thể bỏ qua phần này. Hiện tại, SpaceXAI mới công bố một số thông tin giới hạn về quy trình huấn luyện.
Theo SpaceXAI:
- Grok 4.5 được huấn luyện trên hàng chục nghìn GPU NVIDIA GB300.
- Dữ liệu đào tạo tập trung vào:
- Lập trình (Coding)
- Khoa học
- Kỹ thuật
- Toán học
Mô hình cũng sử dụng Reinforcement Learning (RL) trên hàng trăm nghìn tác vụ, bao gồm nhiều phiên AI Agent kéo dài nhiều giờ liên tục.
Theo bài viết ra mắt của Cursor, tập dữ liệu huấn luyện của Grok 4.5 bao phủ phạm vi rộng hơn so với mô hình Composer 2.5 chuyên lập trình.
Ngoài ra, SpaceXAI cho biết họ đã:
- Loại bỏ dữ liệu trùng lặp.
- Đánh giá chất lượng dữ liệu.
- Chọn lọc dữ liệu theo từng lĩnh vực chuyên môn.
- Xây dựng quy trình huấn luyện cho phép các AI Agent thực hiện các tác vụ dài trong khi mô hình vẫn tiếp tục học từ những nhiệm vụ khác.
Tuy nhiên, đây đều là thông tin do chính SpaceXAI công bố. Từ những dữ liệu hiện có, không nên suy diễn thêm về kiến trúc hoặc cơ chế nội bộ của mô hình ngoài những gì hãng đã xác nhận.
Benchmark của Grok 4.5: Kết quả chính thức và đánh giá độc lập
Khi đánh giá hiệu năng của Grok 4.5, cần lưu ý rằng nguồn dữ liệu và phương pháp thử nghiệm sẽ ảnh hưởng đáng kể đến khả năng so sánh giữa các mô hình AI.
Benchmark lập trình chính thức
Biểu đồ benchmark do SpaceXAI công bố được tổng hợp từ System Card và bảng xếp hạng của nhiều nhà cung cấp khác nhau, thay vì sử dụng một quy trình đánh giá thống nhất.
Cụ thể:
- DeepSWE 1.0 sử dụng framework AI Agent riêng của từng nhà cung cấp.
- DeepSWE 1.1 chuyển sang framework chung mini-swe-agent để đảm bảo điều kiện đánh giá đồng nhất hơn.
Ngoài ra, Cursor cũng tiết lộ rằng một bản snapshot cũ của kho mã nguồn (codebase) đã được đưa vào dữ liệu huấn luyện của Grok 4.5, làm tăng điểm số trên CursorBench. Vì lý do đó, tác giả không đưa CursorBench vào quá trình so sánh.
Theo tác giả, khi điều kiện thử nghiệm thay đổi, một khoảng cách điểm số nhỏ không đủ để kết luận mô hình nào vượt trội hơn.
Mỗi benchmark đánh giá một loại năng lực khác nhau
Các benchmark trong bài không đo lường cùng một kỹ năng:
- DeepSWE đánh giá khả năng AI Agent phân tích và chỉnh sửa mã nguồn trong repository.
- SWE Marathon tập trung vào các nhiệm vụ lập trình phức tạp kéo dài nhiều bước.
- Terminal-Bench 2.1 kiểm tra khả năng làm việc thông qua môi trường dòng lệnh (Terminal).
- SWE-Bench Pro sử dụng các issue thực tế từ những dự án phần mềm mã nguồn mở.
Vì vậy, không có một điểm số duy nhất nào có thể phản ánh toàn diện năng lực của mô hình trên cả bốn loại tác vụ này.
So sánh Grok 4.5 với GPT-5.5 và Claude
SpaceXAI so sánh Grok 4.5 với:
- Claude Fable 5
- GPT-5.5
- Claude Opus 4.8
ở cấu hình Reasoning cao nhất (Maximum Reasoning).

Kết quả cho thấy:
- DeepSWE 1.0
- Grok 4.5: 62%
- Claude Fable 5: 66,1%
- GPT-5.5: 64,3%
- SWE Marathon
- Grok 4.5: 29%
- Claude Opus 4.8: 26%
- → Grok 4.5 dẫn đầu.
- Terminal-Bench 2.1
- Điểm số của Grok 4.5 chỉ thấp hơn khoảng 1 điểm so với hai mô hình dẫn đầu.
- DeepSWE 1.1
- Grok 4.5: 53%
- Claude Fable 5: 70%
- SWE-Bench Pro
- Grok 4.5: 64,7%
- Claude Fable 5: 80,4%
Nhìn chung, Grok 4.5 chỉ dẫn đầu rõ ràng ở một benchmark, trong khi ở các bài đánh giá khác, kết quả thay đổi tùy theo từng loại tác vụ.
Đánh giá độc lập từ Artificial Analysis
Artificial Analysis đã tiến hành một đánh giá riêng biệt. Chỉ số Trí thông minh của họ xếp Grok 4.5 ở vị trí thứ tư với 54 điểm, tăng từ 38 điểm của Grok 4.3. Trên Chỉ số Tác nhân Mã hóa, Grok 4.5 trong Grok Build đạt điểm gần bằng GPT-5.5 trong Codex. AA cũng ghi nhận mức sử dụng token thấp hơn.
Vào ngày 13 tháng 7, Artificial Analysis đã đo được khoảng 120 token mỗi giây, cao hơn con số của SpaceXAI. Nó cũng ghi nhận thời gian chờ 14,5 giây trước khi token đầu tiên xuất hiện, so với mức trung bình 2,7 giây cho mức giá này. Sau thời gian chờ đó, token được tạo ra khá nhanh.
Độ tin cậy và hiện tượng Hallucination
Phân tích nhân tạo cho thấy Grok 4.5 đưa ra nhiều câu trả lời đúng hơn Grok 4.3. Độ chính xác tăng từ 35% lên 52%, nhưng tỷ lệ ảo giác đo được cũng tăng từ 25% lên 54%.
Điều này không hoàn toàn đáng ngạc nhiên: Một mô hình có thể trả lời đúng nhiều câu hỏi hơn đồng thời trở nên tự tin hơn khi trả lời sai. Một đánh giá không chứng minh rằng Grok 4.5 luôn đưa ra nhiều nhận định sai hơn, nhưng nó đã định hình các bài kiểm tra của tôi: mỗi bài kiểm tra đều bao gồm thông tin bị thiếu, mâu thuẫn hoặc tiền đề sai.
So sánh Grok 4.5 và Grok 4.3
Việc lựa chọn giữa Grok 4.5 và Grok 4.3 phụ thuộc vào nhu cầu sử dụng cụ thể, bởi mỗi phiên bản đều có những ưu điểm và hạn chế riêng.
Trong các bài đánh giá độc lập của Artificial Analysis, Grok 4.5 đạt điểm cao hơn và cung cấp giới hạn API lớn hơn. Trong khi đó, Grok 4.3 lại có cửa sổ ngữ cảnh gấp đôi cùng chi phí sử dụng thấp hơn.
| Tiêu chí | Grok 4.5 | Grok 4.3 |
|---|---|---|
| Artificial Analysis Intelligence Index | 54 | 38 |
| Giới hạn API (Tier 0) | 150 RPS / 50M TPM | 37 RPS / 10M TPM |
| Context Window | 500.000 token | 1.000.000 token |
| Giá API tiêu chuẩn | Input: 2 USDOutput: 6 USD / 1 triệu token | Input: 1,25 USDOutput: 2,50 USD / 1 triệu token |
| Giảm giá Batch API | Không có | 20% |
| Điều chỉnh mức độ suy luận (Reasoning) | Low, Medium, High | None, Low, Medium, High |
Khi nào nên chọn Grok 4.5?
Grok 4.5 phù hợp nếu bạn ưu tiên:
- Hiệu năng cao hơn trong các bài đánh giá độc lập.
- Khả năng xử lý đồng thời nhiều yêu cầu API với giới hạn lớn hơn.
- Các tác vụ lập trình, AI Agent và workflow phức tạp yêu cầu tốc độ xử lý cao.
Điểm mạnh của Grok 4.5 không nằm ở cửa sổ ngữ cảnh lớn hơn hay chi phí token thấp hơn, mà ở khả năng xử lý tác vụ hiệu quả hơn và thông lượng API (API throughput) cao hơn.
Khi nào nên chọn Grok 4.3?
Grok 4.3 vẫn là lựa chọn hợp lý nếu bạn cần:
- Làm việc với tài liệu hoặc hội thoại rất dài nhờ context window lên tới 1 triệu token.
- Tiết kiệm chi phí API cho các ứng dụng sử dụng nhiều token.
- Chạy Batch API để được giảm giá 20%.
Tóm lại
Đối với các ứng dụng AI Agent hoặc workflow tự động hóa, việc lựa chọn giữa Grok 4.5 và Grok 4.3 không nên chỉ dựa trên giá mỗi triệu token. Những chỉ số quan trọng hơn cần xem xét gồm:
- Tỷ lệ hoàn thành tác vụ (Completion Rate).
- Số lần phải thử lại (Retry).
- Tổng số token tiêu thụ để hoàn thành một công việc.
Đây mới là các yếu tố phản ánh chính xác chi phí và hiệu quả thực tế khi triển khai AI trong môi trường sản xuất.
Kết luận
Grok 4.5 khẳng định vị thế dẫn đầu của xAI trong cuộc đua Trí tuệ nhân tạo toàn cầu, đặc biệt ở khả năng tự động hóa lập trình và thực thi tác vụ đa bước cho các kỹ sư phần mềm. Với chi phí API hợp lý và hiệu quả sử dụng token cao, Grok 4.5 hứa hẹn là công cụ trợ lực hàng đầu cho cộng đồng phát triển công nghệ hiện đại.







