Toollance

Coding agent local $0 không bao giờ dính rate limit: OpenCode + Qwen2.5-Coder 7B

ai-codinglocal-llmopencode

Một bài viết gần đây của XDA Developers đưa ra một tuyên bố nghe như clickbait nhưng lại khá thành thật: một coding agent local $0 có thể làm được nhiều hơn gói Claude Code $20 — không phải vì nó thông minh hơn, mà vì nó không bao giờ từ chối.

Cách diễn đạt này đáng để phân tích, vì “model local miễn phí thắng model cloud trả phí” thường là sai. Trường hợp này hẹp hơn và hữu ích hơn nhiều so với tiêu đề.

Setup

Stack được giữ cố ý đơn giản:

Tác giả chọn Qwen2.5-Coder 7B chính vì nó đủ nhỏ để dùng thực tế trên một chiếc MacBook Air 16GB mà không biến cả máy thành một cỗ máy AI. Ràng buộc này quan trọng — nhiều lời khuyên kiểu “cứ chạy local đi” ngầm giả định một model 30B+ và một GPU mạnh. Cái này thì không.

Việc kết nối rất đơn giản. Ollama giờ đã có tích hợp chính thức với OpenCode, hoặc bạn có thể trỏ OpenCode thủ công vào endpoint API local của Ollama tại http://localhost:11434/v1.

Vì sao “không bao giờ từ chối” mới là điểm mấu chốt

Gói Claude Code Pro $20 dùng chung một giới hạn sử dụng theo tuần. Đụng trần giữa chừng là bạn phải chờ. Giá trị của model local không nằm ở chỗ nó tốt hơn — mà ở chỗ không có đồng hồ nào đang chạy. Với một dòng liên tục các việc nhỏ, rõ ràng (đổi tên cái này, viết test cho cái kia, format lại đoạn này, giải thích hàm nọ), một model local 7B luôn sẵn sàng sẽ thắng một model thông minh hơn mà bạn vừa hết lượt dùng.

Đây cũng chính là bài học đằng sau việc theo dõi token overhead ở các agent cloud — xem thêm bài của chúng tôi về token overhead của Claude Code. Mỗi token bạn không tiêu trên cloud là một tác vụ bạn không mất vì rate limit. Model local đẩy phép tính này đến giới hạn logic của nó: chi phí biên bằng không, giới hạn bằng không.

Điểm yếu cần thành thật

Bài viết rất rõ ràng về chỗ cách làm này sụp đổ. Nguyên văn: “Qwen2.5-Coder 7B không hề đáng tin bằng Claude ở một tác vụ lớn, định nghĩa mơ hồ, nhưng tôi không cần nó phải như vậy.”

Đó là ranh giới thật sự:

Nước đi hợp lý nhất hằng ngày không phải là “thay thế Claude Code”. Đó là một cách tiếp cận lai (hybrid): dùng local cho khối lượng việc nhỏ, dùng cloud cho vài bài toán khó thực sự đáng bỏ token ra giải.

Cách tự thử

  1. Cài Ollama và tải model: ollama pull qwen2.5-coder:7b
  2. Cài OpenCode.
  3. Dùng tích hợp OpenCode chính thức của Ollama, hoặc trỏ OpenCode vào http://localhost:11434/v1 trong config.
  4. Bắt đầu với các tác vụ nhỏ và cảm nhận điểm mà độ tin cậy của model 7B bắt đầu tụt — đó là ranh giới để bạn quay lại dùng agent cloud.

Kết luận

Tiêu đề có phần thổi phồng, nhưng luận điểm nền tảng thì đúng: với phần lớn công việc code hằng ngày, nút thắt không phải chất lượng model — mà là rate limit. Một agent local miễn phí luôn sẵn sàng lặng lẽ thắng ở nhóm việc đó, miễn là bạn thành thật giao lại các bài toán khó cho một model lớn hơn.

Nguồn: “My $0 local coding agent does more than $20 Claude Code because it never says no”, XDA Developers.