OpenAI giảm giá GPT-5.6 Luna 80%, Terra 20% và tăng tốc Sol: Bảng giá mới, tác động đến API, Codex và ChatGPT Work
OpenAI vừa giảm giá GPT-5.6 Luna tới 80%, Terra 20% và bổ sung Fast mode giúp GPT-5.6 Sol nhanh tối đa 2,5 lần trong API. Bài viết phân tích bảng giá mới, cách usage được tính trong Codex và ChatGPT Work, cùng chiến lược chọn model tối ưu chi phí cho từng workload.
Cập nhật ngày 31/7/2026: OpenAI vừa công bố một đợt điều chỉnh quan trọng cho dòng GPT-5.6, tập trung đồng thời vào ba yếu tố mà mọi đội ngũ triển khai AI đều quan tâm: chi phí, năng lực và tốc độ. Theo thông báo đăng lúc 00:17 ngày 31/7 theo giờ Việt Nam, giá GPT-5.6 Luna được giảm 80%, GPT-5.6 Terra giảm 20%, trong khi GPT-5.6 Sol có thêm lựa chọn xử lý nhanh hơn trên API. OpenAI cũng cho biết mức giá mới đã được phản ánh vào cách tính usage trong Codex và ChatGPT Work, đồng nghĩa cùng một hạn mức hiện có có thể xử lý được nhiều công việc hơn.
Đây không chỉ là một lần giảm giá token thông thường. Nó thay đổi đáng kể cách doanh nghiệp, developer, creator và đội ngũ content operations nên phân tầng workload. Luna giờ trở thành một trong những lựa chọn đáng chú ý nhất cho tác vụ khối lượng lớn; Terra tiến gần hơn tới vị trí model mặc định cho agent hằng ngày; còn Sol có thể được đẩy sang Fast mode khi độ trễ quan trọng hơn chi phí.
OpenAI vừa thay đổi điều gì?
Thông báo mới của OpenAI gồm ba thay đổi chính. Thứ nhất, GPT-5.6 Luna giảm giá 80%. Mức giá tiêu chuẩn cho ngữ cảnh ngắn hiện còn 0,20 USD cho mỗi 1 triệu input token, 0,02 USD cho cached input và 1,20 USD cho mỗi 1 triệu output token. Khi GPT-5.6 được phát hành rộng rãi vào ngày 9/7/2026, Luna có giá 1 USD input và 6 USD output. Như vậy cả hai chiều input lẫn output đều giảm đúng 80%.
Thứ hai, GPT-5.6 Terra giảm giá 20%. Giá tiêu chuẩn hiện là 2 USD cho mỗi 1 triệu input token, 0,20 USD cho cached input và 12 USD cho mỗi 1 triệu output token, thay cho mức 2,50 USD input và 15 USD output khi ra mắt.
Thứ ba, OpenAI nâng cấp Fast mode cho GPT-5.6 Sol. Tài liệu chính thức cho biết Fast mode có thể đạt tốc độ nhanh hơn tối đa 2,5 lần so với Standard processing, đồng thời cung cấp độ trễ ổn định hơn. Tên gọi Priority processing cũng được đổi thành Fast mode từ ngày 30/7/2026, nhưng tham số cũ service_tier: "priority" vẫn hoạt động tương đương với service_tier: "fast".
Bảng giá GPT-5.6 mới nhất trên OpenAI API

Các mức dưới đây được tính trên mỗi 1 triệu token. Bảng tập trung vào Standard processing với ngữ cảnh ngắn, là trường hợp phổ biến nhất đối với API production.
| Model | Input | Cached input | Cache write | Output | Thay đổi |
|---|---|---|---|---|---|
| GPT-5.6 Sol | 5 USD | 0,50 USD | 6,25 USD | 30 USD | Giữ giá Standard |
| GPT-5.6 Terra | 2 USD | 0,20 USD | 2,50 USD | 12 USD | Giảm 20% |
| GPT-5.6 Luna | 0,20 USD | 0,02 USD | 0,25 USD | 1,20 USD | Giảm 80% |
Với prompt có trên 272.000 input token, OpenAI áp dụng giá long context cho toàn bộ request: input được tính gấp đôi và output bằng 1,5 lần mức Standard. Vì vậy giá long context của Sol là 10 USD input và 45 USD output; Terra là 4 USD input và 18 USD output; Luna là 0,40 USD input và 1,80 USD output.
Cache write được tính bằng 1,25 lần giá input chưa cache. Cached input tiếp tục được giảm 90% so với input thông thường. Đây là chi tiết rất quan trọng đối với agent có system prompt dài, bộ quy tắc cố định, taxonomy, schema công cụ hoặc tài liệu tham chiếu được dùng lặp lại.
GPT-5.6 Luna giảm 80%: bước ngoặt cho workload khối lượng lớn

Luna được OpenAI định vị cho các workload nhạy cảm về chi phí và có lưu lượng lớn. Model có context window 1.050.000 token, hỗ trợ tối đa 128.000 output token, reasoning token, function calling, structured outputs, web search, file search, code interpreter, hosted shell, apply patch, skills, computer use, MCP và tool search trong Responses API.
Điểm đáng chú ý là Luna không phải một model chỉ phù hợp cho câu hỏi đơn giản. Trong dòng GPT-5.6, nó là tầng tối ưu chi phí nhưng vẫn có đầy đủ nền tảng để tham gia workflow agent. Mức giá 0,20 USD input và 1,20 USD output mở ra khả năng chuyển nhiều bước xử lý vốn từng phải dùng rule-based system hoặc model nhỏ hơn sang một model có reasoning và tool use tốt hơn.
Những workload phù hợp với Luna gồm phân loại và gắn nhãn nội dung khối lượng lớn, chuẩn hóa metadata, trích xuất dữ liệu có cấu trúc, tạo mô tả và alt text, kiểm tra sơ bộ chất lượng nội dung, tóm tắt hàng nghìn tài liệu, định tuyến yêu cầu tới agent chuyên môn, đánh giá đầu ra vòng một, tạo biến thể SEO, xây chỉ mục tri thức, xử lý queue nền và các tác vụ có thể kiểm tra bằng schema hoặc validator.
Ví dụ chi phí thực tế với Luna
Giả sử một hệ thống mỗi tháng tiêu thụ 100 triệu input token và 20 triệu output token. Với giá cũ, chi phí Luna là 100 USD cho input cộng 120 USD cho output, tổng 220 USD. Với giá mới, chi phí còn 20 USD input cộng 24 USD output, tổng 44 USD. Hệ thống tiết kiệm 176 USD mỗi tháng, tương đương 80%.
Nếu quy mô tăng lên 1 tỷ input token và 200 triệu output token, chi phí giảm từ 2.200 USD xuống 440 USD. Chênh lệch 1.760 USD mỗi tháng đủ lớn để thay đổi mô hình kinh tế của một sản phẩm AI, đặc biệt với micro-SaaS, công cụ content operations, hệ thống nghiên cứu media, crawler có bước phân tích bằng LLM hoặc agent phục vụ lượng người dùng lớn.
GPT-5.6 Terra giảm 20%: ứng viên model mặc định cho agent hằng ngày

Terra được thiết kế để cân bằng giữa trí tuệ và chi phí, tương đương tầng mini trong các thế hệ GPT-5 trước. Model cũng có context window 1.050.000 token, tối đa 128.000 output token và hỗ trợ hệ công cụ tương tự Sol, Luna trong Responses API.
Giá Terra giảm từ 2,50 USD xuống 2 USD cho input và từ 15 USD xuống 12 USD cho output. Mức giảm 20% có vẻ ít gây chú ý hơn Luna, nhưng tác động lại rất rõ với hệ thống đang dùng Terra như model mặc định. Một workload 100 triệu input token và 20 triệu output token trước đây tốn 550 USD, nay còn 440 USD, tiết kiệm 110 USD mỗi tháng mà không cần thay model hoặc thay đổi prompt.
Terra phù hợp cho agent vận hành nội dung, nghiên cứu có web search, xử lý tài liệu, trợ lý chăm sóc khách hàng có truy xuất dữ liệu, tạo báo cáo, kiểm tra SEO, phân tích sản phẩm, workflow tự động hóa nhiều bước, code generation mức trung bình và các tình huống cần chất lượng ổn định hơn Luna nhưng chưa cần sức mạnh tối đa của Sol.
Trong thực tế, Terra có thể trở thành tầng mặc định, Luna xử lý bước tiền xử lý hoặc hậu xử lý, còn Sol chỉ được gọi khi bộ định tuyến phát hiện độ khó cao, rủi ro cao hoặc yêu cầu đầu ra cần độ chính xác và khả năng tự chủ mạnh nhất.
GPT-5.6 Sol Fast mode: nhanh tối đa 2,5 lần nhưng không dành cho mọi request

Giá Standard của GPT-5.6 Sol không đổi: 5 USD input, 0,50 USD cached input, 6,25 USD cache write và 30 USD output cho mỗi 1 triệu token ở ngữ cảnh ngắn. Thay đổi nằm ở lựa chọn Fast mode dành cho API.
OpenAI mô tả Fast mode là chế độ mang lại tốc độ nhanh hơn tối đa 2,5 lần và độ trễ ổn định hơn, phù hợp với ứng dụng hướng trực tiếp tới người dùng, có traffic thường xuyên và coi latency là yếu tố quan trọng. Giá Fast mode hiện gấp đôi Standard: Sol là 10 USD input và 60 USD output; Terra là 4 USD input và 24 USD output; Luna là 0,40 USD input và 2,40 USD output.
Để bật Fast mode cho một request trong Responses API, developer có thể dùng cấu hình sau:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="Phân tích dữ liệu và trả về kế hoạch hành động ưu tiên.",
service_tier="fast",
)
print(response.output_text)
Có thể tiếp tục dùng service_tier="priority" vì OpenAI duy trì hành vi tương đương. Ngoài cấu hình theo từng request, project cũng có thể đặt Project Service Tier thành Fast trong phần Settings.
Khi nào nên trả thêm tiền cho Fast mode?
Fast mode hợp lý khi người dùng đang chờ kết quả theo thời gian thực, chẳng hạn AI copilot trong sản phẩm SaaS, trợ lý phân tích trực tiếp trong dashboard, IDE agent cần phản hồi nhanh, ứng dụng tạo báo cáo ngay trên giao diện hoặc quy trình có nhiều bước nối tiếp khiến độ trễ của từng lần gọi cộng dồn.
Ngược lại, batch job chạy ban đêm, queue tạo metadata, crawl và phân tích nền, tổng hợp newsletter, kiểm tra nội dung hàng loạt hoặc workflow không có người dùng chờ trực tiếp thường không cần Fast mode. Với các trường hợp này, Batch hoặc Flex có thể hợp lý hơn vì giá thấp hơn Standard khoảng 50%.
Batch, Flex và Fast: cùng một model nhưng ba bài toán kinh tế khác nhau

OpenAI hiện cung cấp nhiều service tier để doanh nghiệp đánh đổi giữa chi phí, độ trễ và khả năng dự báo. Standard phù hợp với phần lớn request. Batch và Flex có mức giá bằng khoảng một nửa Standard, đổi lại thời gian xử lý và đặc tính phục vụ khác. Fast có mức giá gấp đôi Standard để ưu tiên tốc độ và độ ổn định độ trễ.
| Service tier | Mức giá tương đối | Phù hợp nhất |
|---|---|---|
| Batch | Khoảng 50% Standard | Xử lý hàng loạt, không cần phản hồi ngay |
| Flex | Khoảng 50% Standard | Workload linh hoạt về thời điểm hoàn thành |
| Standard | Mức cơ sở | Ứng dụng và agent thông thường |
| Fast | Khoảng 200% Standard | Ứng dụng user-facing, latency quan trọng |
Thay vì chọn một model duy nhất cho toàn hệ thống, cách tối ưu hơn là chọn cả model tier lẫn service tier. Ví dụ, Luna Batch có thể dùng cho indexing; Luna Standard cho tác vụ nền gần thời gian thực; Terra Standard cho agent chính; Sol Standard cho yêu cầu phức tạp; Sol Fast cho số ít request quan trọng cần phản hồi nhanh.
Usage trong Codex và ChatGPT Work thay đổi như thế nào?

OpenAI cho biết giá Luna và Terra thấp hơn đã được phản ánh vào cách usage được tính trong Codex và ChatGPT Work. Điều này không nhất thiết có nghĩa mọi gói được tăng một con số quota cố định. Ý nghĩa thực tế là cùng một tác vụ chạy bằng Luna hoặc Terra sẽ tiêu thụ ít usage hơn theo cơ chế tính nội bộ, nhờ đó hạn mức hiện có đi được xa hơn.
Trong Codex, Free và Go có thể truy cập Terra; các gói Plus, Pro, Business và Enterprise có thể chọn Sol, Terra hoặc Luna. Trong ChatGPT Work, người dùng đủ điều kiện cũng có thể chọn cả ba tầng model. Luna và Terra không phải lựa chọn trực tiếp trong cuộc trò chuyện ChatGPT tiêu chuẩn, nhưng có mặt trong Work, Codex và API tùy gói.
Với developer hoặc đội vận hành thường xuyên dùng Codex cho nhiệm vụ dài, việc chuyển các bước ít rủi ro sang Terra hoặc Luna có thể giúp kéo dài usage đáng kể. Sol nên được dành cho kiến trúc hệ thống, debug khó, refactor phức tạp, tác vụ đa bước kéo dài hoặc những thay đổi production có chi phí sai sót cao.
Chiến lược chọn Sol, Terra và Luna sau đợt giảm giá

Chọn Luna khi ưu tiên throughput và chi phí
Luna phù hợp khi workload có quy mô lớn, đầu vào tương đối rõ, có schema hoặc validator để kiểm tra, sai sót có thể phát hiện tự động và mỗi request không cần mức suy luận cao nhất. Đây là lựa chọn tốt cho pipeline content, enrichment dữ liệu, phân loại, chuẩn hóa, tóm tắt, route request và vòng đánh giá đầu tiên.
Chọn Terra làm model mặc định cân bằng
Terra nên được cân nhắc cho phần lớn agent hằng ngày: nghiên cứu, viết và chỉnh sửa nội dung, phân tích tài liệu, tự động hóa marketing, hỗ trợ vận hành, truy xuất dữ liệu, xử lý nhiều công cụ và code ở độ phức tạp vừa phải. Sau khi giảm 20%, khoảng cách chi phí giữa Terra và Luna vẫn lớn, nhưng Terra có vị trí rõ ràng hơn cho tác vụ cần độ tin cậy cao hơn.
Chọn Sol cho tác vụ khó hoặc có giá trị cao
Sol là model frontier của dòng GPT-5.6, dành cho công việc chuyên môn phức tạp, coding agent dài hạn, nghiên cứu, khoa học, an ninh mạng phòng thủ, thiết kế giao diện, computer use và các workflow cần tự chủ cao. Fast mode chỉ nên bật khi giá trị của việc giảm độ trễ lớn hơn phần chi phí tăng thêm.
Một kiến trúc routing thực tế để giảm chi phí AI

Đợt giảm giá này khiến mô hình routing nhiều tầng trở nên hấp dẫn hơn. Một hệ thống có thể dùng Luna để đọc request, phân loại ý định, trích xuất dữ liệu và ước lượng độ khó. Tác vụ thông thường được chuyển sang Terra. Chỉ các request có độ phức tạp cao, dữ liệu không rõ ràng, yêu cầu lập kế hoạch dài hoặc rủi ro sai sót lớn mới được nâng lên Sol.
Sau khi model chính tạo kết quả, Luna có thể tiếp tục thực hiện kiểm tra định dạng, tạo metadata, tóm tắt, chuyển đổi ngôn ngữ hoặc chuẩn bị phiên bản phân phối đa kênh. Nếu kết quả không vượt qua validator, hệ thống mới gọi Terra hoặc Sol để sửa. Cách này giảm chi phí bình quân mà vẫn giữ chất lượng ở những điểm quan trọng.
Đối với một website content operations như VietBoost, Luna có thể đảm nhận media metadata, alt text, taxonomy suggestion, duplicate-intent detection và content QA cơ bản; Terra xử lý nghiên cứu, dàn ý, bài viết và internal linking; Sol xử lý bài phân tích chiến lược, audit hệ thống, thiết kế agent hoặc sửa lỗi kỹ thuật phức tạp.
Checklist tối ưu ngay sau khi OpenAI đổi giá
Trước tiên, hãy cập nhật cost calculator và dashboard tài chính bằng bảng giá mới. Nhiều hệ thống vẫn hard-code giá model trong database, file cấu hình hoặc công cụ quan sát chi phí, dẫn tới báo cáo sai sau khi OpenAI điều chỉnh.
Tiếp theo, rà lại các workflow đang dùng Sol hoặc Terra nhưng thực chất chỉ làm phân loại, extraction, formatting hoặc đánh giá sơ bộ. Chạy eval trên Luna với một tập dữ liệu đại diện, đo chất lượng, latency, tỷ lệ retry và chi phí theo kết quả thành công thay vì chỉ so giá token.
Thứ ba, kiểm tra prompt caching. System prompt dài, tool schema, quy tắc thương hiệu và tài liệu lặp lại nên được tổ chức để tận dụng cached input. Tuy nhiên cần nhớ cache write có giá 1,25 lần input, vì vậy cache chỉ có lợi khi nội dung được tái sử dụng đủ nhiều.
Thứ tư, tách request ngữ cảnh cực dài. Vượt 272.000 input token khiến toàn bộ request chuyển sang long-context pricing. Với một số workflow, retrieval chính xác và compaction tốt có thể tiết kiệm hơn việc đưa toàn bộ kho tài liệu vào một lần gọi.
Cuối cùng, chỉ bật Fast mode cho endpoint thực sự nhạy cảm về latency. Nên đo p50, p95, thời gian hoàn thành toàn workflow và tỷ lệ chuyển đổi của người dùng trước khi quyết định trả mức giá gấp đôi Standard.
Những điểm cần lưu ý để tránh hiểu sai thông báo
Giảm giá Luna và Terra không đồng nghĩa Sol bị giảm giá Standard. Sol vẫn giữ mức 5 USD input và 30 USD output ở ngữ cảnh ngắn. Thay đổi của Sol là Fast mode được tăng tốc, với mức giá riêng cao hơn.
Con số 80% và 20% được tính so với giá ra mắt GPT-5.6 ngày 9/7/2026. Bảng giá hiện tại trên tài liệu API là nguồn cần dùng để tính hóa đơn thực tế, vì bài ra mắt ban đầu vẫn hiển thị mức giá cũ.
Giá token cũng chưa phải toàn bộ chi phí. Web search, image web search, các công cụ chuyên biệt, lưu trữ, hạ tầng orchestration, retry, observability và human review có thể tạo thêm chi phí. Một model rẻ nhưng cần nhiều lần gọi lại chưa chắc có chi phí trên kết quả thành công thấp hơn model mạnh hơn.
Cuối cùng, model routing cần dựa trên eval riêng. Benchmark công khai giúp định hướng, nhưng không thay thế được bộ test phản ánh dữ liệu, ngôn ngữ, tool schema và tiêu chuẩn chất lượng của sản phẩm thực tế.
Kết luận: OpenAI đang đẩy mạnh cuộc đua hiệu suất trên mỗi đô la
Việc giảm 80% cho GPT-5.6 Luna, 20% cho Terra và tăng tốc Sol cho thấy chiến lược của OpenAI không chỉ là đưa năng lực frontier lên cao hơn, mà còn làm cho mỗi tầng model có vai trò kinh tế rõ ràng hơn. Luna trở thành lựa chọn cực kỳ cạnh tranh cho khối lượng lớn; Terra hợp lý hơn cho agent production hằng ngày; Sol tiếp tục phục vụ công việc khó, đồng thời có Fast mode cho tình huống cần tốc độ cao.
Đối với developer và doanh nghiệp, cơ hội lớn nhất không nằm ở việc đổi toàn bộ workload sang model rẻ nhất. Giá trị thực sự đến từ việc thiết kế lại routing, caching, batching và eval để mỗi tác vụ được chạy bằng đúng model, đúng service tier và đúng mức reasoning. Khi làm tốt, đợt điều chỉnh này có thể giảm mạnh chi phí biên, tăng số lượng tác vụ xử lý trong Codex và ChatGPT Work, đồng thời mở đường cho những sản phẩm AI trước đây chưa đạt điểm hòa vốn.
Đọc thêm trên VietBoost
- OpenAI: Coding agent đang thay đổi phần mềm khoa học qua 8 case study như thế nào?
- Thiết kế AI Agent an toàn cho production: MCP, quyền hạn, phê duyệt và audit log



