Kimi K3: Phân tích benchmark và so sánh với các Model AI khác
Moonshot AI công bố Kimi K3 ngày 16/7/2026, mô hình flagship mới nhất trong dòng Kimi với 2,8 nghìn tỷ tham số, lớn nhất trong số các mô hình open-weight từng được phát hành.
Full weight chưa được công bố, Moonshot cho biết sẽ phát hành vào ngày 27/7/2026. Infinity phân tích dữ liệu benchmark chính thức và nhận thấy điểm đáng chú ý không nằm ở số lượng tham số, mà ở mức giá: K3 tính phí ngang tầm frontier, thách thức trực tiếp giả định rằng giá cao là yếu tố phân biệt các mô hình Mỹ.
Tóm tắt các điểm chính
- Kimi K3 lớn hơn khoảng 75% so với DeepSeek V4, có cửa sổ ngữ cảnh 1 triệu token và khả năng hiểu hình ảnh, video native
- Trên Terminal-Bench 2.1, K3 đạt 88,3 điểm, vượt Claude Opus 4.8 (84,6) và gần ngang GPT-5.6 Sol (88,8)
- Giá API: 3,00 USD/triệu token input (cache-miss), 15,00 USD/triệu token output, cao hơn đáng kể so với các mô hình mở Trung Quốc khác
- Trên Kimi Code Bench V2, K3 đạt điểm tương đương Opus 4.8 với chi phí chỉ bằng khoảng một nửa mỗi task
- Full weight dự kiến phát hành ngày 27/7/2026, hiện chỉ dùng được qua dịch vụ hosted của Moonshot
Kimi K3 là gì?
Kimi K3 là mô hình flagship mới nhất trong dòng Kimi của Moonshot AI, được định vị đặc biệt phù hợp cho điều Moonshot gọi là "kịch bản trí tuệ frontier", tức coding dài hơi, công việc tri thức và reasoning. Mô hình hỗ trợ cửa sổ ngữ cảnh 1 triệu token và khả năng hiểu hình ảnh native, đồng nghĩa có thể nhận trực tiếp hình ảnh và video làm input.
Moonshot là startup có trụ sở tại Bắc Kinh, được Alibaba hậu thuẫn (cùng công ty đứng sau dòng Qwen, với Qwen 3.7 là bản mới nhất), và đã phải cạnh tranh giành chỗ đứng khi DeepSeek cùng các phòng lab Trung Quốc khác làm đông đúc thị trường. Về quy mô, K3 lớn hơn khoảng 75% so với DeepSeek V4. Trên benchmark tự công bố của Moonshot, K3 vượt Claude Opus 4.8 và GPT-5.5, nhưng vẫn thua Claude Fable 5 và GPT-5.6 Sol.
Kimi K3 có gì mới so với các phiên bản trước?
Thay đổi được nhắc đến nhiều nhất nằm ngay trên bề mặt: cửa sổ ngữ cảnh 1 triệu token và khả năng hiểu hình ảnh native. Để đạt được điều này, Moonshot thực hiện thay đổi ở ba mảng backend.
Kiến trúc của Kimi K3 thay đổi ra sao?
Mô hình được xây dựng quanh hai thành phần mới: Kimi Delta Attention (KDA), một cơ chế linear-attention lai, và Attention Residuals (AttnRes). Cả hai đều nhằm giúp thông tin lan truyền đáng tin cậy hơn qua các chuỗi dài và mạng sâu.
Bên cạnh đó, Moonshot đẩy độ thưa (sparsity) của cấu hình Mixture-of-Experts xa hơn nữa với một framework gọi là "Stable LatentMoE", chỉ kích hoạt một phần nhỏ expert trong mỗi lượt forward pass. Kết hợp với các thay đổi về huấn luyện và dữ liệu, Moonshot khẳng định điều này mang lại cho K3 hiệu suất scaling gấp khoảng 2,5 lần so với phiên bản tiền nhiệm K2.
Kimi K3 cải thiện coding như thế nào?
Moonshot định vị K3 mạnh ở công việc kỹ thuật dài hơi: duy trì tác vụ nhiều bước với ít giám sát, điều hướng codebase lớn, và điều phối công cụ terminal. Mô hình cũng nổi bật ở một ngách cụ thể: kết hợp coding với suy luận thị giác, ví dụ dùng screenshot và phản hồi hình ảnh để lặp lại quá trình phát triển game, làm việc frontend, hoặc tác vụ CAD. Có khá nhiều ví dụ phát triển game bằng Kimi K3, như một game lấy cảm hứng từ Paper Mario, một game giao hàng bằng máy bay, và một sản phẩm trông giống Halo.
Kimi K3 hỗ trợ công việc tri thức ra sao?
Moonshot cho biết các đánh giá nội bộ (xây dựng từ workflow cộng tác agent thực tế, không phải benchmark công khai) cho thấy mức cải thiện nhất quán của biến thể "max" trên các tác vụ công việc tri thức kiểu production.
Điều này có ý nghĩa gì với người dùng thực tế: tài liệu dài, codebase, hoặc video có thể đưa vào như một input duy nhất thay vì phải chia nhỏ rồi ghép lại, và cùng một request có thể trộn văn bản, hình ảnh và video mà không cần xử lý thêm. Mức cải thiện hiệu suất, nếu được xác nhận, cũng đồng nghĩa nhiều năng lực hơn trên mỗi đô la compute so với K2.
Kimi K3 có những tính năng API nào cho lập trình viên?
Tài liệu API cho thấy rõ hơn những gì đã thay đổi với người dùng thực sự xây dựng trên mô hình này.
| Tính năng | Mô tả |
|---|---|
| Thinking luôn bật | K3 chạy ở chế độ thinking mặc định, cấu hình qua tham số reasoning_effort ở cấp cao nhất thay vì flag thinking cũ của dòng K2. Hiện chỉ hỗ trợ mức max effort |
| Streaming tách riêng reasoning | Response dạng streaming trả về reasoning_content và nội dung câu trả lời cuối cùng như hai delta riêng biệt, cho phép hiện hoặc ẩn phần suy luận của mô hình |
| Input hình ảnh, không nhận URL công khai | Hình ảnh phải gửi dưới dạng base64 hoặc qua tham chiếu file đã upload, mô hình không nhận URL hình ảnh thông thường, video xử lý qua upload file riêng |
| Output có cấu trúc | Hỗ trợ JSON Schema với strict mode, nhưng chỉ ràng buộc trường content cuối cùng, không ràng buộc phần reasoning trace |
| Partial mode | Có thể mồi câu trả lời của assistant bằng một tiền tố cố định và để mô hình tiếp tục từ đó, hữu ích khi cần ép một cách mở đầu cụ thể |
| Nạp công cụ động | Định nghĩa công cụ có thể được chèn giữa cuộc hội thoại qua system message, có hiệu lực từ điểm đó trở đi |
| Cache ngữ cảnh tự động | Cơ chế cache hoạt động tự động, không cần tham số bổ sung |
Lưu ý: Một vài giới hạn khác đáng lưu ý khi tích hợp API: max_completion_tokens mặc định 131.072 và tối đa 1.048.576, các tham số sampling như temperature và top_p là cố định, không thể tùy chỉnh.
Kimi K3 đạt điểm bao nhiêu trên các benchmark?
Tài liệu ra mắt của Moonshot đã có số liệu benchmark thực tế, nhưng cần lưu ý các mô hình khác nhau được chạy qua agent harness khác nhau. K3 được test bằng KimiCode của chính Moonshot, các mô hình Claude chạy qua Claude Code hoặc Terminus 2, còn các mô hình GPT chạy qua Codex. Đây vì vậy không phải một so sánh hoàn toàn thuần nhất, mỗi phòng lab test mô hình của mình trong công cụ tốt nhất của chính họ.
Benchmark coding của Kimi K3
K3 không quét sạch mọi benchmark coding, nhưng có tính cạnh tranh ở gần như mọi nơi. Mô hình dẫn đầu tuyệt đối trên Program Bench và SWE Marathon, chỉ kém GPT-5.6 Sol nửa điểm trên Terminal-Bench 2.1, và vượt Opus 4.8 trên phần lớn các bài test riêng lẻ. Nơi K3 rõ ràng thua là DeepSWE và FrontierSWE, nơi Fable 5 và GPT-5.6 Sol vượt lên trước.

Hiệu năng theo chi phí của Kimi K3
Trên Kimi Code Bench V2 tự công bố của Moonshot, K3 đạt điểm tương đương Opus 4.8 với chi phí chỉ bằng khoảng một nửa mỗi task, và còn xa mới bằng mức chi phí của Fable 5 để đổi lấy vài điểm chênh lệch. Biểu đồ BrowseComp kể một câu chuyện tương tự: K3 đạt điểm cao hơn cả GPT-5.6 Sol lẫn Claude Fable 5 trong khi chi phí mỗi task chỉ bằng một phần nhỏ.

Quy mô tham số của Kimi K3 so với các mô hình khác
Biểu đồ tham số mô hình là hình ảnh rõ nhất cho tuyên bố "mô hình open-weight lớn nhất" đã nêu ở đầu bài. Moonshot nhảy từ 1.000 tỷ tham số của Kimi K2 vượt qua thẳng DeepSeek, Xiaomi và mọi đối thủ khác để đạt 2.800 tỷ tham số chỉ trong một lần phát hành.

Kimi K3 so với các mô hình Trung Quốc khác ra sao?
Ở góc nhìn tổng quan, thị trường mô hình open-weight Trung Quốc đang tách thành hai hướng: các phòng lab như DeepSeek và Z.AI vẫn cạnh tranh bằng giá rẻ, còn Moonshot bắt đầu tính phí cao hơn.
Kimi K3 so với DeepSeek V4 khác biệt ra sao?
DeepSeek V4 nhỏ hơn K3 và có giá thấp hơn nhiều. K3 đặt cược theo hướng khác: lớn hơn, và Moonshot tính phí tương xứng thay vì cố gắng thắng bằng giá.
Kimi K3 so với Qwen khác biệt ra sao?
So sánh này đáng chú ý vì Alibaba hậu thuẫn cả Moonshot lẫn dòng Qwen của chính mình. Tuy nhiên hai dòng này khác nhau đáng kể: mô hình flagship của Qwen là Qwen 3.7 Max hoàn toàn không phải open-weight, mà đóng, độc quyền, chỉ dùng được qua sản phẩm của Alibaba hoặc các host API bên thứ ba. Alibaba vẫn tiếp tục phát hành các mô hình Qwen open-weight nhỏ hơn, nhưng mô hình cấp cao nhất đã chuyển vào dạng đóng.
Kimi K3 so với GLM-5.2 khác biệt ra sao?
GLM-5.2 gần với lối chơi mã nguồn mở Trung Quốc truyền thống hơn: một mô hình thực sự mạnh, cấp phép MIT, giá thấp hơn nhiều so với mức frontier phương Tây. Mô hình này nhỏ hơn K3 và rẻ hơn nhiều, đã tạo được danh tiếng về hiệu năng coding gần tầm frontier với chi phí chỉ bằng một phần nhỏ.
| Mô hình | Tham số | Ngày ra mắt | Intelligence Index | Terminal-Bench 2.1 | Giá (USD/triệu, in/out) | Open-weight? |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 1,6T (49B active) | 24/4/2026 | 44 | Chưa niêm yết độc lập | 0,44 / 0,87 | Có |
| Qwen 3.7 Max (Alibaba) | Không công bố | 20/5/2026 | 56,6 | Không so sánh trực tiếp được | 2,50 / 7,50 | Không, chỉ API |
| GLM-5.2 (Z.AI) | 744B (40B active) | 13/6/2026 | 51 | 78 | 1,40 / 4,40 | Có |
| Kimi K3 | 2,8T (16/896 expert active) | 16/7/2026 | 57 | 88,3 | 3,00 / 15,00 | Có |
Infinity lưu ý hai điểm khi đọc bảng này: Qwen 3.7 Max được đưa vào để tham chiếu nhưng thực chất không phải open-weight nên không phải một đối thủ đồng hạng thực sự trong so sánh này, dù vẫn hợp lý khi giữ lại trong bảng làm mốc tham chiếu. Ngoài ra, việc xác minh độc lập từ bên thứ ba vẫn đang được tiến hành trên diện rộng, nên chưa có con số nào là kết luận cuối cùng.
Kimi K3 so với các phòng lab lớn của Mỹ ra sao?
So với các mô hình đóng, độc quyền từ Anthropic và OpenAI, K3 cho thấy một bức tranh cạnh tranh rõ rệt về giá, dù chưa vượt trội hoàn toàn về năng lực.
So sánh Kimi K3 so với Claude Opus 4.8
Opus 4.8 là flagship của Anthropic trong nhiều tháng qua, và theo số liệu tự công bố của Moonshot, K3 vượt qua Opus 4.8 trên một số benchmark riêng lẻ, đặc biệt là coding. K3 đạt 88,3 điểm trên Terminal-Bench 2.1 so với 84,6 của Opus 4.8.

Khác biệt lớn hơn nằm ở chỗ Opus 4.8 là mô hình đóng, còn K3 là open-weight, nên một khi weight thực sự được phát hành, bất kỳ ai cũng có thể tự host, fine-tune, hoặc chạy mô hình mà không phụ thuộc vào server của Moonshot. K3 vượt Opus 4.8 một điểm trên Intelligence Index, nhưng khoảng cách nới rộng hơn ở mọi khía cạnh khác: K3 có chi phí chỉ bằng khoảng một nửa mỗi task và phản hồi token đầu tiên nhanh hơn khoảng 20 lần.
So sánh Kimi K3 so với Claude Fable 5
Fable 5 là mô hình mới nhất và mạnh nhất của Anthropic, và đây là mô hình duy nhất K3 chưa đuổi kịp. Fable 5 dẫn đầu rõ rệt về trí tuệ tổng thể, và chi phí vận hành cao hơn đáng kể. Fable 5 có giá 10 USD/50 USD mỗi triệu token, so với 3 USD/15 USD của K3.

Nhưng thông điệp của K3 ở đây không phải "ngang bằng Fable 5", mà là "gần đạt tới mức đó, với chi phí chỉ bằng một phần nhỏ". Fable 5 dẫn đầu thoải mái trên Intelligence Index, và thực tế còn nhanh hơn K3 một chút về tốc độ output thô. Điểm K3 vượt lên là chi phí, chạy với mức giá chỉ bằng khoảng một phần ba của Fable 5 mỗi task.
So sánh Kimi K3 so với GPT-5.5
GPT-5.5 xếp ngay dưới K3 trên benchmark tự công bố của Moonshot, và có giá ở tầm tương tự các flagship Mỹ khác, cao hơn đáng kể so với mức giá của K3.

K3 vượt qua GPT-5.5 một chút trên Intelligence Index và chi phí thấp hơn một chút mỗi task. GPT-5.5 thực tế sinh token nhanh hơn một chút khi đã chạy ổn định, nên hai mô hình đánh đổi lẫn nhau tùy vào yếu tố nào quan trọng hơn với người dùng.
So sánh Kimi K3 so với GPT-5.6 Sol
GPT-5.6 Sol là mô hình mới nhất và đắt nhất của OpenAI trong so sánh này, và trên Terminal-Bench 2.1, về cơ bản hòa với K3. Sol đạt 88,8 điểm so với 88,3 của K3.

Khác biệt lớn hơn giống hệt trường hợp với Opus 4.8: Sol là closed-weight, chỉ dùng được qua sản phẩm của chính OpenAI (ChatGPT, Codex, API), trong khi K3 là open-weight. Một khi weight được phát hành, bất kỳ ai cũng có thể tự host hoặc fine-tune. Sol vượt K3 một chút trên Intelligence Index, nhưng K3 vượt lên ở cả tốc độ lẫn chi phí.
Kimi K3 ra mắt khi nào và giá bao nhiêu?
Kimi K3 đã hoạt động ngay từ hôm nay, nhưng chưa đầy đủ. Mô hình ra mắt hôm qua và đã dùng được ngay qua kimi.com, ứng dụng di động Kimi, Kimi Work, Kimi Code, và Kimi API với model ID kimi-k3. Mô hình cũng bắt đầu xuất hiện trên các router bên thứ ba như OpenRouter và OrcaRouter.
Điều chưa được công bố là full weight. Moonshot cho biết sẽ phát hành trước ngày 27/7/2026, trong lúc công ty tiếp tục làm việc với các đối tác inference và người duy trì mã nguồn mở để thống nhất chi tiết kỹ thuật. Cho đến lúc đó, người dùng có thể dùng K3 qua dịch vụ hosted của Moonshot, nhưng chưa thể tải về tự host.
Về giá, K3 dùng cơ chế tính phí pay-as-you-go phẳng thay vì phân tier theo độ dài ngữ cảnh, dù có cửa sổ 1 triệu token. Mức giá chính thức của Moonshot là 0,30 USD/triệu token cho input cache-hit, 3,00 USD/triệu token cho input cache-miss, và 15,00 USD/triệu token cho output, với tỷ lệ cache-hit trên 90% được báo cáo cho các workload coding thông thường, giúp giảm chi phí input thực tế đáng kể trong thực tiễn.
Kimi K3 có những hạn chế nào?
Moonshot khá thẳng thắn về các hạn chế trong blog kỹ thuật của chính mình.
-
Nhạy cảm với lịch sử thinking: K3 được huấn luyện với kỳ vọng toàn bộ reasoning trace được truyền lại ở mỗi lượt. Nếu một agent harness không làm đúng điều này, hoặc nếu một phiên làm việc chuyển sang K3 giữa chừng từ một mô hình khác, chất lượng output có thể trở nên bất ổn. Moonshot khuyến nghị bám sát Kimi Code.
-
Tính chủ động quá mức: Với các tác vụ mơ hồ, K3 có xu hướng tự đưa ra quyết định thay vì hỏi lại người dùng. Nếu cần mô hình bám sát ranh giới cố định, điều này cần được nêu rõ ràng trong system prompt.
-
Khoảng cách trải nghiệm người dùng: Model card nêu thẳng thắn rằng K3 vẫn thể hiện một khoảng cách đáng chú ý về trải nghiệm người dùng so với Claude Fable 5 và GPT-5.6 Sol, một trường hợp hiếm hoi khi một phòng lab tự thừa nhận lợi thế về độ hoàn thiện của đối thủ ngay trong tài liệu ra mắt của chính mình.
-
Tìm kiếm web được đánh dấu chưa ổn định: Moonshot khuyến nghị rõ ràng không nên phụ thuộc vào tính năng tìm kiếm web của K3 vào lúc này, cho biết tính năng này đang được cập nhật.
Kết luận
Kimi K3 là mô hình open-weight lớn nhất từng được phát hành tính đến hiện tại. Mô hình có kiến trúc attention mới nhắm thẳng vào workload ngữ cảnh dài và agentic. Trên các benchmark hiện đã công khai, K3 không phải người chiến thắng tuyệt đối toàn diện, Fable 5 và GPT-5.6 Sol đều vượt qua ở một số mặt, nhưng có tính cạnh tranh cực cao trên các tác vụ coding, agentic và đa phương thức với chi phí chỉ bằng một phần nhỏ.
Infinity nhận thấy đây chính là mạch xuyên suốt của toàn bộ câu chuyện K3: mô hình không cố gắng thắng ở mọi hạng mục, mà cố gắng khiến đánh đổi giữa giá và năng lực trở nên khó lòng bỏ qua, theo cách DeepSeek từng làm với R1 và GLM-5.2 làm gần đây hơn. Điểm khác biệt lần này là Moonshot tính phí ở mức frontier để làm điều đó, không phải mức chiết khấu.
Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.
All Rights Reserved