Coding agent local $0 không bao giờ dính rate limit: OpenCode + Qwen2.5-Coder 7B
Một bài viết gần đây của XDA Developers đưa ra một tuyên bố nghe như clickbait nhưng lại khá thành thật: một coding agent local $0 có thể làm được nhiều hơn gói Claude Code $20 — không phải vì nó thông minh hơn, mà vì nó không bao giờ từ chối.
Cách diễn đạt này đáng để phân tích, vì “model local miễn phí thắng model cloud trả phí” thường là sai. Trường hợp này hẹp hơn và hữu ích hơn nhiều so với tiêu đề.
Setup
Stack được giữ cố ý đơn giản:
- Ollama để chạy model local
- Qwen2.5-Coder 7B làm model
- OpenCode làm giao diện agent nằm bên trên
Tác giả chọn Qwen2.5-Coder 7B chính vì nó đủ nhỏ để dùng thực tế trên một chiếc MacBook Air 16GB mà không biến cả máy thành một cỗ máy AI. Ràng buộc này quan trọng — nhiều lời khuyên kiểu “cứ chạy local đi” ngầm giả định một model 30B+ và một GPU mạnh. Cái này thì không.
Việc kết nối rất đơn giản. Ollama giờ đã có tích hợp chính thức với OpenCode, hoặc bạn có thể trỏ OpenCode thủ công vào endpoint API local của Ollama tại http://localhost:11434/v1.
Vì sao “không bao giờ từ chối” mới là điểm mấu chốt
Gói Claude Code Pro $20 dùng chung một giới hạn sử dụng theo tuần. Đụng trần giữa chừng là bạn phải chờ. Giá trị của model local không nằm ở chỗ nó tốt hơn — mà ở chỗ không có đồng hồ nào đang chạy. Với một dòng liên tục các việc nhỏ, rõ ràng (đổi tên cái này, viết test cho cái kia, format lại đoạn này, giải thích hàm nọ), một model local 7B luôn sẵn sàng sẽ thắng một model thông minh hơn mà bạn vừa hết lượt dùng.
Đây cũng chính là bài học đằng sau việc theo dõi token overhead ở các agent cloud — xem thêm bài của chúng tôi về token overhead của Claude Code. Mỗi token bạn không tiêu trên cloud là một tác vụ bạn không mất vì rate limit. Model local đẩy phép tính này đến giới hạn logic của nó: chi phí biên bằng không, giới hạn bằng không.
Điểm yếu cần thành thật
Bài viết rất rõ ràng về chỗ cách làm này sụp đổ. Nguyên văn: “Qwen2.5-Coder 7B không hề đáng tin bằng Claude ở một tác vụ lớn, định nghĩa mơ hồ, nhưng tôi không cần nó phải như vậy.”
Đó là ranh giới thật sự:
- Nơi local thắng — các chỉnh sửa nhỏ, cụ thể, rõ ràng; bất cứ việc gì bạn sẽ khó chịu nếu mất vào giới hạn tuần; việc bạn không muốn gửi lên cloud chút nào.
- Nơi cloud vẫn thắng — các tác vụ lớn, mơ hồ, nhiều file cần khả năng suy luận mạnh và lập kế hoạch dài hơi. Một model 7B sẽ chật vật ở đây, còn Claude hay một model frontier thì không.
Nước đi hợp lý nhất hằng ngày không phải là “thay thế Claude Code”. Đó là một cách tiếp cận lai (hybrid): dùng local cho khối lượng việc nhỏ, dùng cloud cho vài bài toán khó thực sự đáng bỏ token ra giải.
Cách tự thử
- Cài Ollama và tải model:
ollama pull qwen2.5-coder:7b - Cài OpenCode.
- Dùng tích hợp OpenCode chính thức của Ollama, hoặc trỏ OpenCode vào
http://localhost:11434/v1trong config. - Bắt đầu với các tác vụ nhỏ và cảm nhận điểm mà độ tin cậy của model 7B bắt đầu tụt — đó là ranh giới để bạn quay lại dùng agent cloud.
Kết luận
Tiêu đề có phần thổi phồng, nhưng luận điểm nền tảng thì đúng: với phần lớn công việc code hằng ngày, nút thắt không phải chất lượng model — mà là rate limit. Một agent local miễn phí luôn sẵn sàng lặng lẽ thắng ở nhóm việc đó, miễn là bạn thành thật giao lại các bài toán khó cho một model lớn hơn.
Nguồn: “My $0 local coding agent does more than $20 Claude Code because it never says no”, XDA Developers.