Bài 5/12 trong chuỗi Kinh tế Vibe Coding
Nếu như bạn có thói quen chỉ mở một cửa sổ chat với AI rồi làm việc từ ngày này qua ngày khác, từ hạng mục này sang hạng mục công việc khác thì đó, đó là cách làm việc với AI tệ nhất. Nhưng nếu trong cửa sổ làm việc với AI Agent như Claude Code hoặc Codex mà mỗi phiên làm việc bạn chỉ hỏi 1-2 câu rất ngắn rồi ngừng thì đó cũng chưa phải cách làm việc tốt vì đơn giá tính trên mỗi phiên đó rất cao. Vậy như thế nào là một phiên tối ưu? trong bài viết này tôi sẽ bóc tách dữ liệu thật trong những phiên làm việc của tôi để bạn thấy câu trả lời.

Khi tôi đem toàn bộ 62 phiên làm việc thật trên website này ra đo đạc chi tiết, những con số thực tế kể một câu chuyện khác hẳn. Phiên ngắn ngủi mà chúng ta tưởng là tiết kiệm hóa ra lại đắt hơn — nhưng chỉ ở đoạn thật sự ngắn, và lợi thế của phiên dài cạn sớm hơn nhiều so với hình dung của tôi lúc đầu.
Trong bài về chỗ tiền thật sự đi, chúng ta đã thấy câu gõ mới chỉ chiếm 0,5% hóa đơn, còn phần lớn chi phí nằm ở việc đọc lại bộ nhớ đệm (cache). Khi nhìn sâu hơn vào độ dài của từng phiên, chính cơ chế bộ nhớ đệm này đã tạo ra một nghịch lý kinh tế thú vị giữa phiên ngắn và phiên dài.
Lời khuyên ai cũng nói, và số đo nói ngược
Thói quen dùng lệnh xóa phiên liên tục bắt nguồn từ một trực giác cơ bản: không ai muốn một câu hỏi đơn giản vào buổi chiều phải trả tiền cho cả buổi sáng làm việc. Nhiều người thậm chí đặt ra nguyên tắc cứ sau vài chục phút hoặc sau năm mười câu lệnh là gõ xóa phiên để làm mới lại từ đầu.
Để kiểm chứng xem thói quen đó có thật sự tiết kiệm tiền hay không, tôi xếp 62 phiên làm việc trong bộ dữ liệu theo độ dài rồi tính chi phí trung bình cho mỗi lượt gọi ở từng nhóm. Biểu giá dùng để quy đổi là biểu giá của Claude Opus 5.
Bốn phiên ngắn nhất, từ mười lượt trở xuống, có chi phí trung bình 0,3212 $ cho mỗi lượt. Tám phiên dài nhất, từ 120 lượt trở lên, chỉ tốn 0,1554 $. Chênh nhau gấp đôi.
Nhưng con số thú vị nằm ở chỗ khác. Nhóm từ 50 lượt trở xuống — nhóm mà hầu hết chúng ta gọi là "phiên ngắn" — đã có chi phí 0,1580 $ mỗi lượt, tức gần như ngang bằng nhóm dài nhất. Và trên toàn bộ 62 phiên, con số trung bình là 0,1577 $.
Nói cách khác, cái giá phải trả cho việc mở phiên mới có thật, nhưng nó tan gần hết chỉ sau vài chục lượt gọi. Đắt gấp đôi chỉ xảy ra với những phiên bạn mở lên hỏi đúng một hai câu rồi đóng.
Vì sao phiên ngắn lại đắt hơn mỗi lượt
Nguyên nhân khiến phiên ngắn trở nên đắt đỏ trên mỗi lượt gọi nằm ở chi phí khởi tạo ngữ cảnh ban đầu.
Khi bạn mở một phiên mới toanh, agent bắt đầu với một bộ nhớ đệm hoàn toàn trống rỗng. Để có thể làm việc, nó phải đọc và ghi toàn bộ ngữ cảnh nền vào bộ nhớ đệm tạm thời: hướng dẫn cố định của dự án, các file mã nguồn liên quan, và định nghĩa của các công cụ.
Trong biểu giá của Anthropic, thao tác ghi cache bậc 1 giờ có đơn giá đắt gấp đôi so với giá input thông thường. Ngược lại, thao tác đọc từ cache lại rẻ hơn giá input thông thường tới mười lần — với Claude Opus 5 là 0,5 $ so với 5 $ cho mỗi triệu token.
Ở bốn phiên ngắn nhất, tỉ lệ đọc cache chỉ đạt 72,71% lượng input. Chi phí ghi cache ban đầu bị phân bổ cho quá ít lượt tương tác, khiến mỗi lượt gọi phải gánh một phần chi phí khởi tạo rất lớn.
Ngược lại, ở các phiên từ 120 lượt trở lên, tỉ lệ đọc cache đạt tới 98,64%. Khối ngữ cảnh nền sau khi được nạp và ghi một lần duy nhất ở đầu phiên sẽ được tái sử dụng liên tục hàng trăm lần với mức giá đọc cache siêu rẻ (0,5 $ mỗi triệu token). Khoản phí ghi đắt đỏ ban đầu được chia mỏng ra, kéo mức giá trung bình của mỗi lượt tương tác xuống.
Điều đáng nói là đường cong này bão hòa rất nhanh. Nhóm từ 50 lượt trở xuống đã đạt 95,07%, nhóm từ 100 lượt trở lên đạt 98,51%. Giữa hai mốc đó, phần tiết kiệm còn lại chỉ là vài phần trăm cuối cùng của một tỉ lệ vốn đã gần chạm trần.
Chỗ lời khuyên cũ vẫn đúng
Thấy phiên dài có đơn giá mỗi lượt rẻ hơn, liệu chúng ta có nên giữ một phiên duy nhất và làm việc liên tục từ ngày này qua ngày khác?
Câu trả lời dứt khoát là không. Và đây là chỗ chúng ta cần rạch ròi về mặt giới hạn đo lường.
Đây là chi phí cho mỗi lượt trả lời, không phải chi phí cho mỗi việc làm xong. Một phiên dài có thể tốn nhiều lượt hơn cho cùng một việc, và bộ dữ liệu này không tách được điều đó. Tổng tiền của một phiên vẫn tăng theo độ dài.
Khi một phiên kéo dài quá mức, tổng chi phí tuyệt đối của phiên đó vẫn liên tục tăng lên vì mỗi lượt gọi mới vẫn phải đọc lại toàn bộ khối ngữ cảnh khổng lồ tích lũy từ quá khứ. Hơn nữa, khi lịch sử trò chuyện quá dài và chứa nhiều nội dung không còn liên quan, agent rất dễ bị phân tâm, hiểu sai ngữ cảnh, hoặc sinh mã nguồn thừa thãi, dẫn đến việc bạn phải tốn thêm nhiều lượt gọi phụ để sửa chữa.
Một lượt gọi rẻ đi vài phần trăm không có ý nghĩa gì nếu bạn phải mất tới năm lượt gọi lòng vòng để hoàn thành một việc mà lẽ ra chỉ cần hai lượt trong một phiên sạch sẽ. Đơn giá mỗi lượt giảm không đồng nghĩa với việc tổng chi phí công việc giảm.
Và có một con số nữa khép lại chuyện này. Tôi lấy mười phiên dài nhất, so một phần tư đầu phiên với một phần tư cuối phiên: ngữ cảnh mỗi lượt gọi phình lên 2,13 lần, chi phí mỗi lượt tăng 1,78 lần. Cùng một câu hỏi, hỏi ở cuối phiên đắt gần gấp đôi hỏi ở đầu phiên. Lợi thế của phiên dài không nằm ở chỗ mỗi lượt rẻ đi, mà nằm ở chỗ bạn không phải nạp lại từ đầu — còn cái giá thì vẫn tăng đều theo từng lượt.
Ba phiên đắt nhất chiếm gần một phần tư hóa đơn
Tổng chi phí quy đổi trên toàn bộ 62 phiên là 755,26 $ — đo trên repo này, cửa sổ nhật ký 14/07–02/09/2026. Bảng chi tiết theo loại token và theo mô hình nằm ở bài tổng hợp số liệu gốc.
Phiên rẻ nhất chỉ tốn 0,12 $ — mở lên hỏi một câu rồi đóng. Phiên đắt nhất tiêu tốn tới 34,00 $. Ba phiên đắt nhất chiếm 11,60% tổng chi phí quy đổi.
Phần lớn ngân sách không bị tiêu hao đều tay qua những phiên bình thường hằng ngày, mà dồn vào một nhúm phiên kéo dài quá lâu và tích lũy khối lượng ngữ cảnh quá lớn. Những phiên cá biệt đó chính là nơi rủi ro chi phí phát sinh mạnh nhất nếu bạn không chủ động kiểm soát.
Vậy khi nào thì nên xóa phiên
Nếu xóa phiên quá sớm thì tốn tiền ghi cache lại từ đầu, còn để phiên quá dài thì tổng tiền phình lên và agent mất tập trung. Điểm cân bằng không nằm ở một con số cố định — nó nằm ở mục tiêu công việc: xóa phiên khi bạn đổi sang một việc khác, giữ phiên khi vẫn đang trong cùng một mạch.
Toàn bộ file mã nguồn, thông báo lỗi và lịch sử trao đổi của việc cũ không còn giá trị gì cho việc mới. Giữ lại chỉ khiến bạn trả tiền đọc lại những dữ liệu vô ích. Ngược lại, đang lần theo một luồng xử lý phức tạp hay đang gỡ lỗi phát sinh từ bước trước thì giữ nguyên phiên là lựa chọn tối ưu — bạn tận dụng được khối ngữ cảnh đã nạp sẵn với mức giá đọc cache rẻ mười lần.
Còn nếu bạn chỉ cần hỏi vài ba câu ngắn mà không cần chạm vào mã nguồn — động não, tranh luận thuật toán, gọt giũa một đoạn văn — thì đừng mở phiên dòng lệnh. Đưa những nhu cầu đó sang cửa sổ chat thông thường, nơi không phải gánh chi phí nạp quy tắc dự án. Tôi đã phân tích cách tổ chức bàn làm việc đa tầng này trong bài Vì Sao AI Chat Dần Lu Mờ Trong Kỷ Nguyên AI Agent?.
Cái bẫy của phiên tưởng đã đóng
Có một điểm mù mà kỷ luật đóng phiên bằng tay không chạm tới. Sáng 30/08/2026, tôi mở app Claude lúc 08:32 và thấy hạn mức năm giờ đã hao mất 8% — dù không ai gõ một câu lệnh nào từ đêm qua. Lần theo nhật ký, tôi phát hiện lúc 08:08 một phiên đã đóng từ chiều hôm trước bất ngờ tự chạy hai lượt: kênh theo dõi Artifact (artifact-watch-lifecycle) gửi thông báo "mất kết nối", đánh thức toàn bộ phiên. Bộ nhớ đệm đã nguội qua đêm, nên 502.840 token phải ghi cache mới ở đơn giá đắt gấp hai mươi lần giá đọc — chỉ để đọc một dòng báo lỗi.
Bài học: đóng cửa sổ dòng lệnh không hủy kênh theo dõi. Cách xử lý dứt điểm là lưu trữ phiên (archive) ngay khi xong việc — thao tác này hủy mọi kênh liên kết mà không tốn thêm lượt gọi. Quy tắc ngắn gọn nhất: vừa xuất bản Artifact xong là mốc kết thúc phiên — đóng hoặc lưu trữ ngay, đừng để nó treo lơ lửng.
📥 Tải miễn phí
Bộ Khung Repo Cho AI Agent
Điều tôi nhận ra
Xóa phiên liên tục sau mỗi câu hỏi ngắn chỉ khiến bạn liên tục trả chi phí ghi cache mà không kịp tận dụng lợi thế đọc cache. Để phiên chạy vô tận bất chấp chuyển ngữ cảnh sẽ dẫn tới những phiên cá biệt ngốn hàng chục đô la mà hiệu quả đi xuống. Điểm dừng hợp lý nằm ở chỗ việc bạn đang làm vừa xong — và kỷ luật đóng phiên chủ động cần đi kèm kỷ luật lưu trữ chủ động.
Muốn ước tính chi phí cho quy trình của riêng mình, bạn có thể nhập thông số thực tế vào công cụ tính chi phí AI để thấy rõ sự khác biệt giữa các kịch bản.
Trong cái túi ngữ cảnh đó, có đúng một thành phần chắc chắn có mặt từ lượt gọi đầu tiên tới lượt cuối cùng của mọi phiên — và nó là thứ duy nhất bạn toàn quyền cắt gọt. Chuyện của bài kế tiếp.





