Claude Opus 5 có gì mới? Toàn bộ tính năng nổi bật

Claude Opus 5 là mô hình ngôn ngữ lớn (Large Language Model – LLM) mạnh nhất trong hệ sinh thái Claude do Anthropic phát triển, được ra mắt chính thức vào ngày 24/07/2026. Đây là phiên bản kế nhiệm của Claude Opus 4.8, với những cải tiến lớn nhất tập trung vào khả năng suy luận chuyên sâu (Deep Reasoning), AI Agent (Agentic AI), xử lý các tác vụ dài và nhiều bước (Long-Horizon Tasks), cùng khả năng mở rộng hiệu năng bằng cách tăng tài nguyên tính toán trong quá trình suy luận (Test-time Compute Scaling).

Trong bài viết này, hãy cùng tìm hiểu Claude Opus 5 có gì mới, những cải tiến nổi bật, benchmark mới nhất và liệu đây có phải là mô hình AI mạnh nhất hiện nay hay không.

Mô hình mới

Mô hìnhAPI Model IDMô tả
Claude Opus 5claude-opus-5Dành cho các tác vụ lập trình AI Agent phức tạp và công việc doanh nghiệp quy mô lớn.

Claude Opus 5 sở hữu cửa sổ ngữ cảnh (context window) lên đến 1 triệu token, trong đó 1 triệu token vừa là giá trị mặc định vừa là giới hạn tối đa, và không có phiên bản với cửa sổ ngữ cảnh nhỏ hơn.

Ngoài ra, mô hình còn hỗ trợ:

  • Context window: 1 triệu token.
  • Số lượng token đầu ra tối đa: 128.000 token.
  • Thinking được bật mặc định (Thinking On by Default): Claude sẽ tự động thực hiện quá trình suy luận trước khi tạo câu trả lời nhằm nâng cao độ chính xác và chất lượng phản hồi.

Tính năng mới

Anthropic đã bổ sung một loạt tính năng kỹ thuật quan trọng trên Claude Opus 5 nhằm giúp các nhà phát triển tối ưu hóa quy trình gọi API, nâng cao hiệu suất xử lý và tiết kiệm chi phí vận hành. Dưới đây là các tính năng mới đột phá vừa được ra mắt:

Claude Opus 5 có gì mới? Toàn bộ tính năng nổi bật

1. Thay đổi công cụ ngay trong cuộc hội thoại (Mid-conversation Tool Changes) (Beta)

Claude Opus 5 cho phép thêm hoặc loại bỏ các công cụ (Tools) giữa các lượt hội thoại mà vẫn giữ nguyên Prompt Cache, thay vì phải gửi lại toàn bộ danh sách công cụ cố định trong suốt một phiên làm việc như trước đây.

Tính năng Mid-conversation Tool Changes hiện đang ở giai đoạn Beta. Để sử dụng, bạn cần thêm beta header sau vào yêu cầu API: mid-conversation-tool-changes-2026-07-01

Tham số fallbacks được bổ sung chế độ mới mang tên default.

Thay vì tự xây dựng và duy trì danh sách các mô hình dự phòng (fallback models), chế độ này sẽ tự động áp dụng các mô hình dự phòng do Anthropic khuyến nghị, dựa trên từng loại trường hợp từ chối (refusal category).

Toàn bộ tính năng fallbacks hiện đang ở giai đoạn Beta.

Để sử dụng, hãy thêm beta header sau: server-side-fallback-2026-07-01

Header này hỗ trợ cả:

  • Chế độ default.
  • Danh sách mô hình dự phòng do người dùng tự chỉ định.

Trong khi đó, phiên bản header cũ: server-side-fallback-2026-06-01 chỉ hỗ trợ danh sách mô hình dự phòng được khai báo thủ công.

Claude Opus 5 giảm độ dài tối thiểu của Prompt có thể lưu vào Prompt Cache xuống còn 512 token, thay vì 1.024 token như trên Claude Opus 4.8.

Điều này đồng nghĩa với việc:

  • Nhiều prompt ngắn trước đây không đủ điều kiện để lưu cache trên Claude Opus 4.8.
  • Nay có thể tự động được lưu vào Prompt Cache trên Claude Opus 5.
  • Không cần thay đổi mã nguồn (code) để tận dụng cải tiến này.

Chi tiết giới hạn của từng mô hình được trình bày trong tài liệu Prompt Caching.

Anthropic giới thiệu Fast Mode (Research Preview) dành riêng cho Claude Opus 5.

Hiện tại, Fast Mode chỉ khả dụng trên Claude APIchưa được hỗ trợ trên các nền tảng:

  • Amazon Bedrock
  • Google Cloud
  • Microsoft Foundry

Chi phí sử dụng Fast Mode

  • 10 USD / 1 triệu token đầu vào (Input Tokens)
  • 50 USD / 1 triệu token đầu ra (Output Tokens)

Bạn có thể tham khảo thêm tài liệu Fast Mode để biết cách đăng ký quyền truy cập, các mô hình được hỗ trợ và bảng giá chi tiết.

Thay đổi trong cách hoạt động

Không chỉ nâng cấp tính năng API, Claude Opus 5 còn điều chỉnh mạnh mẽ cơ chế vận hành cốt lõi và tư duy của mô hình. Việc hiểu rõ những thay đổi trong cách hoạt động dưới đây sẽ giúp bạn điều chỉnh hệ thống prompt và tham số một cách chính xác nhất:

Chế độ Thinking được bật mặc định

Trên Claude Opus 4.8, các yêu cầu (request) sẽ không sử dụng chế độ Thinking trừ khi bạn chủ động cấu hình: thinking: {"type": "adaptive"}. Trong khi đó, trên Claude Opus 5, cùng một yêu cầu sẽ được thực thi với Thinking bật mặc định.

Mô hình sẽ tự động quyết định khi nào cần suy luận và mức độ suy luận phù hợp cho từng lượt hội thoại, trong khi tham số effort được sử dụng để kiểm soát độ sâu của quá trình suy luận (thinking depth).

Về mặt API, giá trị cấu hình không thay đổi. Thiết lập: thinking: {"type": "adaptive"} vẫn hoàn toàn hợp lệ và có tác dụng tương đương với hành vi mặc định của Claude Opus 5.

Lưu ý: Vì max_tokens là giới hạn cứng cho tổng số token đầu ra, bao gồm token dành cho quá trình suy luận (Thinking) và token của câu trả lời cuối cùng, bạn nên xem xét tăng giá trị max_tokens đối với các tác vụ trước đây chạy trên Claude Opus 4.8 mà không bật Thinking.

Anthropic vẫn cho phép tắt chế độ Thinking thông qua API, tuy nhiên việc này sẽ chịu các giới hạn liên quan đến tham số effort được mô tả bên dưới.

Tham số Effort trở nên quan trọng hơn

Trên Claude Opus 5, tham số effort có ảnh hưởng lớn hơn đáng kể đến chất lượng đầu ra so với các phiên bản Opus trước đây.

Anthropic cho biết Claude Opus 5 chuyển đổi lượng tài nguyên suy luận bổ sung thành chất lượng kết quả tốt hơn một cách ổn định hơn, vì vậy việc lựa chọn mức effort sẽ tác động trực tiếp đến khả năng suy luận của mô hình.

Claude Opus 5 hỗ trợ đầy đủ các mức Effort sau:

  • low – Mức suy luận thấp, ưu tiên tốc độ và tiết kiệm token.
  • medium – Mức suy luận trung bình.
  • high – Mức mặc định, cân bằng giữa chất lượng và hiệu năng.
  • xhigh – Suy luận rất sâu cho các tác vụ phức tạp.
  • max – Mức cao nhất, cho phép mô hình thực hiện quá trình suy luận sâu nhất có thể.

Anthropic khuyến nghị nên bắt đầu với high (mức mặc định), sau đó điều chỉnh dựa trên kết quả đánh giá thực tế:

  • Giảm Effort nếu chất lượng vẫn đáp ứng yêu cầu để tiết kiệm chi phí token và giảm độ trễ.
  • Tăng Effort khi xử lý các bài toán có độ phức tạp cao, yêu cầu suy luận nhiều bước hoặc cần độ chính xác tối đa.

Đặc biệt, khi sử dụng mức xhigh hoặc max, bạn nên cấu hình max_tokens ở mức đủ lớn để Claude Opus 5 có đủ không gian thực hiện quá trình suy luận, phối hợp giữa các tác nhân phụ (subagents) và gọi nhiều công cụ (tool calls) trước khi tạo câu trả lời cuối cùng.

Ví dụ dưới đây minh họa một yêu cầu API thiết lập effort ở mức max, tức mức suy luận cao nhất mà Claude Opus 5 hỗ trợ.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 64000,
    "stream": true,
    "output_config": {
      "effort": "max"
    },
    "messages": [
      {
        "role": "user",
        "content": "Explain why the sum of two even numbers is always even."
      }
    ]
  }'
# 64k max_tokens can run past the non-streaming time limit; stream the events.
ant messages create --stream --format jsonl <<'YAML'
model: claude-opus-5
max_tokens: 64000
output_config:
  effort: max
messages:
  - role: user
    content: Explain why the sum of two even numbers is always even.
YAML
client = anthropic.Anthropic()

with client.messages.stream(
    model="claude-opus-5",
    max_tokens=64000,
    output_config={"effort": "max"},
    messages=[
        {
            "role": "user",
            "content": "Explain why the sum of two even numbers is always even.",
        }
    ],
) as stream:
    response = stream.get_final_message()

print(response)
const client = new Anthropic();

const stream = client.messages.stream({
  model: "claude-opus-5",
  max_tokens: 64000,
  output_config: {
    effort: "max"
  },
  messages: [
    {
      role: "user",
      content: "Explain why the sum of two even numbers is always even."
    }
  ]
});

const response = await stream.finalMessage();
console.log(response);
AnthropicClient client = new();

var parameters = new MessageCreateParams
{
    Model = Model.ClaudeOpus5,
    MaxTokens = 64000,
    OutputConfig = new OutputConfig
    {
        Effort = Effort.Max
    },
    Messages = [new() { Role = Role.User, Content = "Explain why the sum of two even numbers is always even." }]
};

var response = await client.Messages.CreateStreaming(parameters).Aggregate();
Console.WriteLine(response);
client := anthropic.NewClient()

stream := client.Messages.NewStreaming(context.TODO(), anthropic.MessageNewParams{
	Model:     anthropic.ModelClaudeOpus5,
	MaxTokens: 64000,
	OutputConfig: anthropic.OutputConfigParam{
		Effort: anthropic.OutputConfigEffortMax,
	},
	Messages: []anthropic.MessageParam{
		anthropic.NewUserMessage(anthropic.NewTextBlock("Explain why the sum of two even numbers is always even.")),
	},
})

response := anthropic.Message{}
for stream.Next() {
	event := stream.Current()
	if err := response.Accumulate(event); err != nil {
		log.Fatal(err)
	}
}
if err := stream.Err(); err != nil {
	log.Fatal(err)
}

fmt.Println(response)
AnthropicClient client = AnthropicOkHttpClient.fromEnv();

MessageCreateParams params = MessageCreateParams.builder()
    .model(Model.CLAUDE_OPUS_5)
    .maxTokens(64000L)
    .outputConfig(OutputConfig.builder()
        .effort(OutputConfig.Effort.MAX)
        .build())
    .addUserMessage("Explain why the sum of two even numbers is always even.")
    .build();

MessageAccumulator accumulator = MessageAccumulator.create();
try (var streamResponse = client.messages().createStreaming(params)) {
    streamResponse.stream().forEach(accumulator::accumulate);
}

Message response = accumulator.message();
IO.println(response);
$client = new Client();

$stream = $client->messages->createStream(
    maxTokens: 64000,
    messages: [
        ['role' => 'user', 'content' => 'Explain why the sum of two even numbers is always even.']
    ],
    model: Model::CLAUDE_OPUS_5,
    outputConfig: ['effort' => Effort::MAX],
);

$accumulator = MessageAccumulator::forMessages();
foreach ($stream as $event) {
    $accumulator->accumulate($event);
}

echo $accumulator->message();
client = Anthropic::Client.new

response = client.messages.stream(
  model: Anthropic::Model::CLAUDE_OPUS_5,
  max_tokens: 64000,
  output_config: {
    effort: :max
  },
  messages: [
    { role: "user", content: "Explain why the sum of two even numbers is always even." }
  ]
).accumulated_message

puts response

Trên Claude Opus 5, Thinking đã được bật mặc định, vì vậy không cần khai báo trường thinking trong yêu cầu API như ở các phiên bản trước.

Việc tắt Thinking chỉ được hỗ trợ khi Effort ở mức High hoặc thấp hơn

Trên Claude Opus 5, cấu hình: thinking: {"type": "disabled"} chỉ được chấp nhận khi tham số effort được đặt ở mức high hoặc thấp hơn.

Nếu bạn sử dụng:

  • thinking: {"type": "disabled"}
  • cùng với effortxhigh hoặc max

thì API sẽ trả về lỗi 400 (Bad Request).

Đây là hành vi mặc định của Claude Opus 5 và các phiên bản về sau, được kiểm tra trên mọi yêu cầu API. Đồng thời, đây cũng là một thay đổi mang tính phá vỡ tương thích (Breaking Change) so với Claude Opus 4.8, bởi trước đây việc bật hoặc tắt Thinking không phụ thuộc vào giá trị của effort.

Nếu hệ thống hiện tại của bạn đang tắt Thinking nhưng vẫn sử dụng mức xhigh hoặc max, Anthropic khuyến nghị một trong hai cách sau:

  • Giữ Thinking ở trạng thái tắt, đồng thời giảm effort xuống mức high hoặc thấp hơn.
  • Giữ nguyên mức effortxóa trường thinking, để Claude Opus 5 sử dụng chế độ Thinking mặc định.

Lưu ý khi tắt Thinking

Khi Thinking bị vô hiệu hóa, Claude Opus 5 đôi khi có thể:

  • Ghi trực tiếp lệnh gọi công cụ (tool call) vào nội dung văn bản thay vì trả về đúng khối tool_use theo định dạng API.
  • Hiển thị các thẻ XML nội bộ trong phần phản hồi mà người dùng nhìn thấy.

Vì vậy, Anthropic khuyến nghị nên giữ Thinking ở trạng thái bật và điều chỉnh effort xuống mức thấp hơn nếu muốn giảm chi phí token hoặc cải thiện tốc độ phản hồi.

Trong trường hợp hệ thống bắt buộc phải chạy với Thinking Disabled, bạn nên tham khảo tài liệu Running with Thinking Disabled để áp dụng các kỹ thuật prompt giúp hạn chế những hành vi không mong muốn này.

Những thay đổi trong hành vi của mô hình

Bên cạnh các thay đổi về API, Claude Opus 5 còn có nhiều thay đổi trong cách hoạt động so với Claude Opus 4.8 mà bạn có thể nhận thấy ngay cả khi không cần chỉnh sửa bất kỳ dòng mã nào.

  • Câu trả lời mặc định chi tiết hơn: Claude Opus 5 có xu hướng tạo ra các phản hồi và tài liệu hoàn chỉnh dài hơn, đầy đủ hơn và giàu thông tin hơn so với các phiên bản trước.
  • Chủ động cập nhật tiến độ trong các phiên AI Agent: Trong các phiên làm việc theo mô hình AI Agent, Claude Opus 5 thường xuyên thông báo cho người dùng về tiến độ xử lý nhiệm vụ, giúp quá trình thực hiện minh bạch và dễ theo dõi hơn.
  • Phân công công việc cho Subagents linh hoạt hơn: Khi hoạt động trong các hệ thống đa tác nhân (Multi-Agent Frameworks), Claude Opus 5 có xu hướng chủ động giao nhiệm vụ cho các Subagents nhiều hơn, giúp phân chia công việc và xử lý các tác vụ phức tạp hiệu quả hơn.
  • Tự xác minh kết quả trước khi trả lời: Claude Opus 5 còn có khả năng tự kiểm tra và xác minh kết quả của chính mình ngay cả khi người dùng không yêu cầu.

Do đó, Anthropic khuyến nghị loại bỏ các hướng dẫn xác minh được sử dụng cho các phiên bản Claude trước, chẳng hạn như:

  • “Include a final verification step.” (Thêm bước kiểm tra cuối cùng.)
  • “Use a subagent to verify.” (Sử dụng Subagent để xác minh.)

Việc giữ lại các hướng dẫn này có thể khiến Claude Opus 5 xác minh quá mức (over-verification), làm tăng thời gian xử lý, lượng token tiêu thụ và độ dài của câu trả lời mà không mang lại nhiều lợi ích.

Để tối ưu các hành vi trên, Anthropic khuyến nghị tham khảo tài liệu Prompting Claude Opus 5, trong đó hướng dẫn cách thiết kế prompt phù hợp để điều chỉnh độ dài phản hồi, mức độ suy luận, khả năng phối hợp Subagents và các hành vi đặc trưng của mô hình.

Những cải tiến về năng lực

So với Claude Opus 4.8, Claude Opus 5 không chỉ là một bản nâng cấp nhỏ mà là một bước tiến vượt bậc (step-change improvement) về khả năng xử lý và suy luận. Đồng thời, Anthropic cho biết Claude Opus 5 mang lại hiệu năng AI ở cấp độ tiên phong (frontier intelligence) với chi phí chỉ bằng một nửa so với Claude Fable 5.

Những cải tiến mới nổi bật nhất bao gồm:

Deep Reasoning (Suy luận chuyên sâu)

Claude Opus 5 có khả năng duy trì quá trình phân tích nhiều bước trên các chuỗi bài toán dài và phức tạp.

Mô hình có thể:

  • Theo dõi logic xuyên suốt nhiều bước suy luận.
  • Kết nối các thông tin liên quan để đưa ra kết luận chính xác hơn.
  • Hạn chế mất ngữ cảnh hoặc sai lệch khi xử lý các yêu cầu có độ phức tạp cao.

Agentic Coding và Long-Horizon Tasks

Claude Opus 5 được tối ưu cho các tác vụ lập trình theo mô hình AI Agent và các quy trình kéo dài nhiều bước.

Mô hình có khả năng:

  • Duy trì mục tiêu trong suốt quá trình sử dụng công cụ.
  • Hoàn thành các tính năng trải dài trên nhiều tệp (multi-file features).
  • Thực hiện các đợt tái cấu trúc mã nguồn (large refactors).
  • Xây dựng tính năng hoàn chỉnh từ đầu đến cuối (end-to-end feature development).
  • Hạn chế để lại các đoạn mã chưa hoàn thiện (stubs) hoặc các phần giữ chỗ (placeholders).

Test-time Compute Scaling

Claude Opus 5 có khả năng chuyển đổi lượng tài nguyên suy luận bổ sung thành chất lượng kết quả tốt hơn.

Khi tăng mức effort (tối đa đến max), mô hình sẽ:

  • Suy luận sâu hơn.
  • Phân tích nhiều khả năng hơn.
  • Đưa ra kết quả chính xác và đáng tin cậy hơn đối với các bài toán khó.

Hiệu quả cao ngay cả ở mức Effort thấp

Một điểm cải tiến đáng chú ý là Claude Opus 5 vẫn đạt chất lượng đầu ra rất tốt ngay cả khi sử dụng các mức:

  • low
  • medium

So với các mức Effort cao hơn, hai mức này:

  • Tiêu thụ ít token hơn.
  • Giảm độ trễ khi phản hồi.
  • Vẫn duy trì chất lượng đáng kể đối với nhiều tác vụ thông thường.

Review Code và phát hiện lỗi (Code Review & Bug Finding)

Claude Opus 5 cải thiện đáng kể khả năng:

  • Review mã nguồn.
  • Phát hiện lỗi lập trình.
  • Xác định các bug thực sự với tỷ lệ chính xác cao.
  • Giảm số lượng cảnh báo sai (false positives).

Ngay cả ở các mức Effort thấp, mô hình vẫn duy trì độ chính xác rất tốt khi phân tích mã nguồn.

Vision (Hiểu hình ảnh)

Khả năng xử lý hình ảnh của Claude Opus 5 cũng được nâng cấp.

Mô hình có thể hiểu tốt hơn:

  • Biểu đồ (Charts).
  • Tài liệu (Documents).
  • Sơ đồ (Diagrams).
  • Giao diện người dùng (UI).
  • Thiết kế Front-end.

Hiệu quả đạt mức cao nhất khi Claude được phép sử dụng các công cụ để:

  • phân tích nhiều lần,
  • cắt (crop) vùng cần quan tâm,
  • và tự xác minh kết quả trước khi trả lời.

Xử lý ngữ cảnh dài (Long Context)

Claude Opus 5 hỗ trợ cửa sổ ngữ cảnh (Context Window) lên tới 1 triệu token, trong đó:

  • 1 triệu token là giá trị mặc định
  • đồng thời cũng là giới hạn tối đa.

Trong toàn bộ phạm vi ngữ cảnh này, mô hình vẫn duy trì tốt khả năng:

  • tuân thủ hướng dẫn (Instruction Following),
  • gọi công cụ (Tool Calling),
  • và suy luận (Reasoning)

một cách nhất quán.

Xử lý tài liệu và công việc văn phòng

Claude Opus 5 được tối ưu cho các tác vụ văn phòng và tài liệu phức tạp.

Mô hình có thể:

  • tạo và chỉnh sửa bảng tính nhiều trang (multi-sheet spreadsheets),
  • sử dụng các công thức Excel phức tạp,
  • xây dựng các bộ slide chuyên nghiệp,
  • trình bày tài liệu với cấu trúc rõ ràng và logic.

Phối hợp đa tác nhân (Multi-Agent Coordination)

Claude Opus 5 hoạt động hiệu quả hơn trong các hệ thống Multi-Agent.

Mô hình có thể:

  • điều phối nhiều Subagents cùng lúc,
  • áp dụng mô hình Writer – Verifier hiệu quả,
  • giảm tình trạng các Agent ghi đè hoặc làm mất kết quả của nhau.

Để khai thác tối đa những khả năng này, Anthropic khuyến nghị tham khảo tài liệu Prompting Claude Opus 5, trong đó hướng dẫn các mẫu prompt tối ưu cho từng nhóm tác vụ.

Tính khả dụng

Album Claude Opus 5 hiện có trên:

  • API của Claude: có sẵn cho tất cả khách hàng, như claude-opus-5.
  • AWS: có sẵn thông qua Claude trên Amazon Bedrock, dưới dạng anthropic.claude-opus-5. Claude Opus 5 cũng có thể truy cập được thông qua InvokeModelAPI trên bedrock-runtime, được phục vụ bởi cùng một cơ sở hạ tầng; việc tích hợp Claude trên Amazon Bedrock (phiên bản cũ) không bao gồm nó trong bảng ID mô hình được phiên bản hóa ARN của nó.
  • Google Cloud: có sẵn thông qua Claude trên Google Cloud, dưới dạng claude-opus-5.
  • Microsoft Foundry: có sẵn thông qua Claude trong Microsoft Foundry.

Claude Opus 4.8 vẫn có sẵn trên tất cả các nền tảng này.

Kết luận

Tổng kết lại, câu hỏi Claude Opus 5 có gì mới đã được giải đáp một cách thuyết phục qua loạt cải tiến từ khả năng suy luận nâng cao, thiết kế tối ưu cho lập trình tự trị đến các lớp bảo mật mạnh mẽ. Mô hình này thiết lập một tiêu chuẩn mới cho phân khúc AI Agent cao cấp, định hình tương lai công nghệ năm 2026.

Kỷ nguyên nơi trí tuệ nhân tạo có thể độc lập đồng hành cùng các kỹ sư để giải quyết những thách thức phần mềm phức tạp nhất đã chính thức bắt đầu. Việc sớm tiếp cận và khai thác sức mạnh của Claude Opus 5 chắc chắn sẽ tạo ra lợi thế cạnh tranh vượt trội cho cá nhân và doanh nghiệp trong làn sóng đổi mới sáng tạo này.