Công cụ miễn phí

Tiền của coding agent đi đâu?

Nhập token theo từng vai trong workflow để thấy chi phí API mỗi task, chi phí retry và CPAT — trước khi bạn mở rộng thành một AI Dev Team.

1. Vai trong workflow

Hướng dẫn mục này ↓

Một task có thể qua nhiều vai. Mỗi vai có model, token và số lần gọi riêng.

Cache write 5 phút = 1.25x input, 1 giờ = 2x input, đọc cache = 0.1x input

2. Giả định workflow

Hướng dẫn mục này ↓

Retry và tỉ lệ được chấp nhận quyết định chi phí thực bạn bỏ ra cho một task xong.

5. Hướng dẫn dùng công cụ

Công cụ này trả lời đúng một câu hỏi: một task làm xong tốn bao nhiêu tiền. Con số đó là CPAT — chi phí cho mỗi task được chấp nhận — chứ không phải giá mỗi triệu token, cũng không phải chi phí một lần gọi API. Một con agent gọi API sáu lượt, chạy lại hai lần, rồi bị bạn bỏ đi ba trên mười kết quả thì đơn giá token gần như không nói được gì về hoá đơn cuối tháng.

Vai trong workflow — mỗi ô nhập gì

Một task có thể đi qua nhiều vai, mỗi vai chạy model riêng với lượng token riêng. Bấm Một agent khi bạn chỉ có một con agent làm hết, bấm AI Dev Team để dựng sẵn bốn vai Scout, Architect, Builder, Reviewer, hoặc tự thêm vai tới tối đa sáu.

Ô nhậpĐiền gì vào đó
Tên vaiNhãn để bạn đọc kết quả theo vai. Không tham gia vào phép tính.
ModelModel vai đó chạy. Đơn giá lấy từ bảng giá ở mục 6, kèm link nguồn chính thức.
Input chưa cacheToken prompt gửi lên lần đầu, tính giá input đầy đủ.
Input đã cacheToken đọc lại từ cache. Trên toàn bộ bảng giá hiện tại, khoản này rẻ đúng mười lần so với input thường.
Cache-write 5 phútToken ghi vào cache với TTL ngắn. Anthropic tính 1,25 lần giá input.
Cache-write 1 giờToken ghi vào cache với TTL dài. Anthropic tính 2 lần giá input.
Output tokensToken model sinh ra. Đây luôn là đơn giá đắt nhất trong một lượt gọi.
Số lần gọi/taskMột vai hiếm khi xong trong một lượt. Chi phí của vai được nhân với số này.

Số token lấy từ trường usage trong response API, hoặc từ trang usage của nhà cung cấp. Đừng ước lượng theo số chữ: phần input đã cache thường lớn gấp nhiều lần phần input mới, và chính tỉ lệ giữa hai phần đó quyết định hoá đơn.

Hai ô cache-write tự khoá lại khi model bạn chọn thuộc nhà cung cấp không tính phí ghi cache. OpenAI và Google không thu khoản này, Anthropic thì có và thu đắt hơn input thường — nên chuyện dùng cache là tiết kiệm hay tốn kém còn tuỳ nhà cung cấp.

↑ Về ô nhập vai

Giả định workflow — hai ô làm chi phí phình lên

Số retry kỳ vọng là trung bình một task phải chạy lại trọn vẹn bao nhiêu lần trước khi ra được kết quả dùng được. Agent không bao giờ chạy lại: nhập 0. Cứ mười task lại có bốn task phải làm lại một lượt: nhập 0,4.

Tỉ lệ được chấp nhận là trong mười kết quả agent trả về, bao nhiêu phần trăm bạn thực sự dùng. Bảy trên mười thì nhập 70. Ba kết quả bị bỏ vẫn tốn tiền API như thường, nên chi phí của chúng dồn hết vào những task còn lại — đó là lý do CPAT luôn cao hơn chi phí một lượt chạy.

Task mỗi tháng là số task được chấp nhận bạn cần mỗi tháng, dùng để ra dòng chi phí tháng.

↑ Về ô giả định

Bốn dòng kết quả nói gì

  • Chi phí cơ bản/task — tiền của mọi vai cộng lại cho một lượt chạy, chưa tính retry, chưa tính kết quả bị loại.
  • Chi phí retry — phần cộng thêm do phải chạy lại.
  • Chi phí/task — tiền thật cho một lượt task đi tới đích, đã gồm retry.
  • Chi phí tháng — CPAT nhân với số task mỗi tháng. Đây là con số mang đi lập ngân sách.

Khối Theo vai, mỗi task là chỗ đáng nhìn nhất khi bạn chạy nhiều vai, vì nó chỉ thẳng ra vai nào đang ngốn tiền. Thường không phải vai gọi nhiều lượt nhất, mà là vai được gắn model đắt nhất.

↑ Về khối kết quả

So với thuê bao — vì sao chỗ này chỉ là ước tính

Nhập số tiền thuê bao bạn thực trả mỗi tháng và số task được chấp nhận trong tháng đó, công cụ chia ra tiền trên mỗi task để bạn đặt cạnh CPAT.

Đây là phân bổ chi phí chứ không phải quy đổi tương đương, và lý do nằm ở phía nhà cung cấp: họ công bố cửa sổ reset — Claude reset mỗi năm giờ, cộng thêm một hạn mức tuần — nhưng không công bố hạn mức đó lớn bao nhiêu nếu tính bằng token. Thiếu mẫu số thì không quy đổi được. Hãy đọc con số này như một mốc so sánh thô, đừng bê thẳng vào bảng ngân sách.

↑ Về ô thuê bao

Công thức và một ví dụ chạy đủ số

chi phí 1 lượt gọi   = Σ (token ÷ 1.000.000 × đơn giá tương ứng)
chi phí 1 vai / task = chi phí 1 lượt gọi × số lần gọi
chi phí cơ bản/task  = tổng chi phí của mọi vai
chi phí retry        = chi phí cơ bản/task × số retry kỳ vọng
chi phí/task         = chi phí cơ bản/task + chi phí retry
CPAT                 = chi phí/task ÷ tỉ lệ được chấp nhận
chi phí tháng        = CPAT × số task mỗi tháng

Ví dụ một agent chạy Claude Sonnet 5, mỗi lượt gọi tốn 20.000 token input mới, 180.000 token đọc từ cache, 20.000 token ghi cache 5 phút và 8.000 token output. Một task đi qua 3 lượt gọi, retry kỳ vọng 0,4, tỉ lệ được chấp nhận 70%, 200 task mỗi tháng. Các con số dưới đây chạy qua đúng bảng giá ở mục 6, nên chúng không bao giờ lệch với giá bạn đọc được ở đó.

Chi phí cơ bản/task$0.62
Chi phí retry$0.25
Chi phí/task$0.87
CPAT$1.24
Chi phí tháng$247.20

Chỗ đáng nhìn là khoảng cách giữa $0.62 và $1.24: retry cộng với phần kết quả bị loại đẩy chi phí thật lên 2 lần. Cùng một bảng giá, cùng một lượng token, chỉ hai giả định về chất lượng đã làm ngân sách khác hẳn.

↑ Về đầu công cụ

6. Giá, độ mới và phần còn thiếu

Giá được kiểm tra ngày .

Khoảng trống đã biết
  • Alibaba Model Studio: xác nhận được tên model (qwen3.7-plus, qwen3.8-max, kimi-k2.7-code) nhưng trang doc công khai không đăng giá. Bỏ ra khỏi bảng thay vì dùng số chưa kiểm chứng.
  • Gói thuê bao (Claude, ChatGPT, Google AI): nhà cung cấp công bố CỬA SỔ reset (Claude: mỗi 5 giờ, cộng một hạn mức tuần reset vào giờ cố định của tài khoản) nhưng KHÔNG công bố hạn mức đó lớn bao nhiêu tính bằng token. Vì thiếu mẫu số nên không quy đổi được sang token; phần so sánh thuê bao trong công cụ chỉ chia phí tháng cho số task được chấp nhận và phải dán nhãn ƯỚC TÍNH.
  • Phí lưu cache theo giờ của Google chưa nằm trong công thức MVP vì cần thêm ô nhập thời lượng.