Claude Code Gửi Tới 75.000 Token Trước Khi Đọc Prompt Của Bạn — Cách Giảm Con Số Này
Một thử nghiệm gần đây của công ty tư vấn AI Systima so sánh mức tiêu thụ token giữa Claude Code và giải pháp mã nguồn mở thay thế OpenCode, và phát hiện Claude Code gửi khoảng 32.800 token trước khi xử lý cả yêu cầu đầu tiên của bạn — con số này tăng lên 75.000 token trong các phiên làm việc thực tế khi có nhiều tool và context được nạp thêm (theo báo cáo của DigitalToday).
Nếu bạn đang trả tiền theo token hoặc theo dõi sát giới hạn sử dụng hàng tuần, đây không phải sai số làm tròn — đó là context bạn đang trả tiền trước cả khi đặt một câu hỏi.
Overhead này đến từ đâu
Mỗi phiên Claude Code nạp một số thứ vào context trước khi xử lý prompt của bạn:
- System prompt và định nghĩa các tool có sẵn (Read, Edit, Bash, v.v.)
- Mọi file
CLAUDE.mdtrong phạm vi — global, project, và local - Schema của mọi MCP server đang kết nối, kể cả những server bạn không dùng trong phiên đó
- Các skill có sẵn và định nghĩa slash command
Không có gì trong số này bị lãng phí một cách vô cớ — đây chính là điều giúp Claude Code hoạt động tự chủ mà không cần bạn giải thích lại toàn bộ stack mỗi tin nhắn. Nhưng điều đó cũng có nghĩa overhead tỷ lệ với những gì bạn đã cấu hình, chứ không phải với việc bạn thực sự đang yêu cầu nó làm gì.
Vì sao điều này quan trọng lúc này
Thông tin này xuất hiện vào một thời điểm đáng chú ý: Anthropic liên tục gia hạn quyền truy cập Claude Fable 5 và giữ giới hạn tốc độ hàng tuần của Claude Code cao hơn 50% trên các gói trả phí (đến hết ngày 19 tháng 7, theo Simon Willison) — nhiều khả năng là phản ứng trước chính áp lực sử dụng kiểu này. Chi phí token nền cao hơn mỗi phiên đồng nghĩa người dùng tiêu hao giới hạn hàng tuần nhanh hơn, nên việc tối ưu cấu hình của riêng bạn sẽ giúp có thêm nhiều phiên làm việc trong cùng giới hạn.
Cách giảm overhead của riêng bạn
Rút gọn file CLAUDE.md. Các hướng dẫn tồn tại lâu ngày thường lỗi thời. Hãy xóa các quy tắc không còn áp dụng, và chỉ giữ lại những gì thực sự thay đổi hành vi của Claude — không phải context chung mà nó có thể tự suy ra từ code.
Ngắt kết nối các MCP server không dùng trong phiên đó. Mỗi server đang kết nối đều thêm schema tool của nó vào context được nạp, bất kể bạn có dùng đến hay không. Hãy tắt các server không cần cho tác vụ hiện tại.
Dùng /compact trước khi context phình to, không phải sau đó. Nén cuộc trò chuyện sớm giúp context làm việc nhỏ hơn cho mọi tin nhắn tiếp theo, thay vì để nó tích lũy suốt cả một phiên dài.
Ưu tiên skill có phạm vi giới hạn thay vì hướng dẫn luôn bật. Nếu một workflow chỉ áp dụng đôi khi, hãy đưa nó vào một skill được gọi khi cần thay vì một quy tắc CLAUDE.md thường trực được nạp vào mọi phiên bất kể có liên quan hay không.
Kết luận
Đây không phải lỗi — đó là đánh đổi để có một agent có thể đọc codebase của bạn và hành động mà không cần cầm tay chỉ việc. Nhưng nếu bạn chạm giới hạn hàng tuần sớm hơn dự kiến, file CLAUDE.md và các kết nối MCP mới là nơi cần xem xét đầu tiên, không phải prompt của bạn.