Tại sao phân tuyến mô hình phản tác dụng — và cách xây dựng tác nhân không tiêu tốn ngân sách


Định tuyến mô hình (model routing) hứa hẹn giảm đáng kể chi phí cho các agent AI bằng cách chuyển các tác vụ thông thường sang những mô hình rẻ hơn như Claude Haiku, trong khi dành các mô hình frontier như Claude Sonnet cho những tác vụ suy luận phức tạp. Khi cấu hình đúng, các chiến lược định tuyến có thể cắt giảm chi phí suy diễn (inference) từ 40–85%. Nhưng nếu bạn triển khai định tuyến sai trong một agent đa lượt, chi phí có thể cao hơn so với không định tuyến chút nào. Dưới đây là lý do và cách khắc phục.
How Token Costs Accumulate Across a Session
Để hiểu vì sao định tuyến đôi khi phản tác dụng, cần nắm rõ cách chi phí token cộng dồn trong các phiên agent. Mỗi lượt trong cuộc hội thoại làm tăng tổng số token, và chính sự cộng dồn này vừa là nguồn tiết kiệm vừa là rủi ro của bạn.
Mỗi lượt trong một phiên agent mang theo một khối lượng token ngày càng lớn. Bảng dưới đây mô tả sự dịch chuyển phân bố token trong một phiên ba lượt điển hình:
| Turn | New Input Tokens | Cached Tokens |
| Turn 1 | High (baseline message) | None |
| Turn 2 | Low (follow-up message) | High (all of Turn 1) |
| Turn 3+ | Minimal | Very high (compounding) |
Đến lượt 3, token đã được cache chiếm phần lớn khối lượng token của bạn. Đây chính là hiệu quả bạn muốn bảo vệ. Việc chuyển đổi mô hình giữa phiên sẽ phá hủy hoàn toàn lớp bảo vệ này.


Why Does Switching Models Mid-Session Increase Your Costs?
Chuyển đổi mô hình giữa phiên xóa bỏ mọi tiết kiệm từ prompt cache đã tích lũy, vì cache của mỗi nhà cung cấp là tách biệt theo mô hình — mô hình mới không có quyền truy cập vào lịch sử đã được lưu của mô hình trước đó và phải đọc lại toàn bộ hội thoại từ đầu với chi phí token đầu vào chuẩn.
Bộ nhớ đệm prompt hoạt động dựa trên khớp tiền tố. Nhà cung cấp LLM lưu một hàm băm của tiền tố thông điệp của bạn. Miễn là tiền tố giữ ổn định và mô hình không đổi, mỗi lượt kế tiếp sẽ hưởng lợi từ giá token đầu vào được giảm mạnh nhờ cache. Anthropic, ví dụ, cung cấp đến 90% giảm cho các token đầu vào được cache. Ngay khi bạn đổi mô hình, mô hình mới bắt đầu với cache lạnh. Nó sẽ xử lý toàn bộ lịch sử hội thoại với chi phí token đầu vào đầy đủ, như thể Lượt 1 chưa từng tồn tại. Với các phiên ngắn, đây chỉ là sự bất tiện nhỏ. Nhưng trong các workflow agent dành cho lập trình, nơi cửa sổ ngữ cảnh có thể kéo dài đến 50.000 token hoặc hơn, một lần chuyển mô hình giữa phiên có thể làm tăng chi phí đến mức xóa sạch mọi khoản tiết kiệm mà định tuyến mong đợi mang lại.
What You Should Not Do
Một số mẫu định tuyến phổ biến trông giống như tối ưu hóa nhưng thực tế làm xấu hồ sơ chi phí của bạn. Đây là các nguyên nhân thường gặp dẫn đến tăng chi phí bất ngờ trong hệ thống agent sản xuất:
- Chuyển mô hình giữa một cuộc hội thoại dài mà không tóm tắt — Điều này buộc mô hình mới phải xử lý lại toàn bộ lịch sử hội thoại với chi phí token đầu vào đầy đủ. Hình phạt cache miss cho một phiên 20.000 token có thể đắt hơn cả khoản tiết kiệm mong đợi từ việc chuyển đổi.
- Bật auto-routing giữa phiên trong các cổng LLM — Các công cụ gateway LLM như LiteLLM, OpenRouter, và Portkey hỗ trợ định tuyến tự động dựa trên độ phức tạp truy vấn. Điều này hữu dụng cho các truy vấn một lượt, nhưng bật nó giữa phiên trong vòng lặp agent sẽ làm mất giá trị KV cache tại mọi ranh giới định tuyến.
- Thay đổi tool hoặc system prompt giữa phiên — Định nghĩa công cụ nằm trong tiền tố được cache. Thêm hoặc xoá một tool trong khi phiên đang chạy sẽ làm vô hiệu hoá toàn bộ cache ở phần sau thay đổi đó. Hãy coi cấu hình tool của phiên là bất biến sau khi bắt đầu.
- Sử dụng cuộc gọi nén (compression) với một mô hình khác — Nhiều agent nén lịch sử dài bằng cách tạo một cuộc gọi tóm tắt với một mô hình rẻ hơn. Nếu cuộc gọi đó dùng một mô hình khác hoặc system prompt khác, nó sẽ sinh ra một cache miss riêng và đặt lại cache phiên chính khi trả về.
Tránh các mẫu này đòi hỏi thiết kế phiên có chủ ý, chứ không chỉ logic định tuyến đúng đắn. Chiến lược định tuyến của bạn chỉ hiệu quả bằng kiến trúc phiên bạn xây dựng.
What to Do Instead


Việc định tuyến mô hình hiệu quả trong hệ thống agent là vấn đề ở mức phiên, không phải mỗi truy vấn. Các thực hành sau giúp bạn tận dụng lợi ích chi phí của định tuyến mà không đánh mất những tiết kiệm từ prompt cache làm cho agent AI có chi phí kinh tế bền vững:
- Giảm tối thiểu số lượt cho mỗi tác vụ và ủy quyền sớm — Giữ các phiên agent ngắn nhất có thể. Khi biết một tác vụ đòi hỏi ngữ cảnh lớn (ví dụ: refactor nhiều file phức tạp, kiểm tra tuân thủ dài hơi), hãy ủy quyền cho một subagent ngay từ đầu, trước khi phiên tích lũy lịch sử. Phiên ngắn nghĩa là cache nhỏ, và chi phí khi chuyển mô hình sẽ thấp hơn.
- Sử dụng mô hình subagent để đa dạng hoá mô hình — Thay vì đổi mô hình trong cùng một phiên, hãy xây một agent điều phối (orchestrator) phân nhiệm các subtasks cho các subagent chuyên dụng. Mỗi subagent bắt đầu mới với chỉ ngữ cảnh cần thiết và chạy trên mô hình phù hợp nhất cho nhiệm vụ đó. Không có việc vô hiệu hoá cache. Không có khoản phí do lịch sử tích lũy. Mẫu này (thường gọi là kiến trúc orchestrator–subagent) là cách sạch nhất để có đa dạng mô hình dựa trên chi phí mà không phải trả giá cho việc đổi model giữa phiên.
- Chủ động tóm tắt trước bất kỳ chuyển mô hình bắt buộc nào — Nếu phải chuyển mô hình giữa phiên, hãy thực hiện một thủ tục bàn giao có cấu trúc: tóm tắt rõ ràng ngữ cảnh đang hoạt động, trạng thái nhiệm vụ hiện tại và các quyết định còn mở thành một thông điệp gọn. Bắt đầu một phiên mới với mô hình mới chỉ sử dụng bản tóm tắt đó làm đầu vào. Bạn sẽ trả chi phí token đầu vào cho một bản tóm tắt nhỏ thay vì để mô hình mới phải replay một lịch sử 20.000 token đã qua.
- Khoá cấu hình phiên — System prompt, định nghĩa tool và lựa chọn mô hình nên cố định khi bắt đầu phiên. Hãy coi chúng như một schema — thay đổi chúng giữa phiên là một sự kiện migration chứ không phải là tinh chỉnh cấu hình. Nếu framework agent của bạn cho phép nạp tool động, kiểm toán rõ thời điểm và nơi các nạp đó xảy ra so với ranh giới tiền tố cache của bạn.
How JFrog Boost Protects Your Cache Efficiency Automatically
Mặc dù quản lý logic định tuyến mô hình là điều quan trọng để agent hoạt động bền vững, nhưng sự phình to ngữ cảnh (context bloat) là một lực nhân rất lớn gây lãng phí token. Mỗi khi agent chạy build, thực thi bộ test hoặc kéo logs, hàng trăm dòng tiếng ồn lặp đi lặp lại từ terminal sẽ tràn vào lịch sử hội thoại.
Trong một phiên đa lượt, tiếng ồn này cộng dồn rất nhanh. Nó biến một lịch sử vốn nên gọn thành một payload 50.000 token chỉ trong vài lượt. Điều này trực tiếp phá vỡ engineering chi phí của bạn: nếu phiên bị phình bởi log build ồn ào, “hình phạt cache miss” chúng ta đã thảo luận sẽ trở nên đắt đỏ theo cấp số nhân ngay khi có một lần chuyển mô hình giữa phiên.
Khi sử dụng các coding agent, các nhà phát triển không nên phải thủ công chọn lọc output từ terminal chỉ để tránh một bước build ồn ào làm tăng hóa đơn LLM.
JFrog Boost được thiết kế để giải quyết trực tiếp vấn đề phình ngữ cảnh ngay trong workflow phát triển. Boost là một công cụ CLI nhẹ giúp nén thông minh đầu ra terminal trong vòng lặp agent, loại bỏ boilerplate lặp lại trong khi vẫn giữ nguyên các tín hiệu quan trọng như stack trace lỗi chính xác. Thay vì gửi hàng ngàn token của raw build logs tới mô hình, Boost cắt gọn payload trước khi nó chạm tới agent.
Bằng cách giữ lịch sử phiên gọn, Boost giảm mạnh số token cơ sở được xử lý mỗi lượt. Điều này giảm thiểu hình phạt tài chính khi phải chuyển mô hình không thể tránh, kéo dài hiệu quả của cửa sổ ngữ cảnh, và tối đa hóa hiệu quả kinh tế của các prompt cache của bạn.


Designing for Sustainable Agent Economics
Định tuyến mô hình mang lại tiết kiệm thực sự, nhưng chỉ khi nó tôn trọng cơ chế nền tảng của prompt cache ở các nhà cung cấp. Để xây workflow agent bền vững, hãy coi lịch sử hội thoại như một tài sản được tối ưu hoá cao: Giữ các phiên chính gọn nhẹ, ủy quyền ngữ cảnh nặng cho các subagent tồn tại ngắn, và đảm bảo mọi chuyển đổi mô hình cần thiết được xử lý thông qua một bản tóm tắt trạng thái có cấu trúc thay vì replay lịch sử thô.
Chung quy lại, xây dựng hệ thống agent bền vững về mặt kỹ thuật đồng nghĩa với việc coi hiệu quả token là một ràng buộc cốt lõi bên cạnh tốc độ và độ chính xác.
Để triển khai tự động các tối ưu ở mức phiên này và loại bỏ lãng phí ngữ cảnh trong workflow phát triển của bạn, bạn có thể cài đặt Boost và bắt đầu tiết kiệm token ngay hôm nay.
Connect with us
Chúng tôi rất mong được nghe về kinh nghiệm, mô hình kiến trúc và những thách thức của bạn với việc định tuyến mô hình. Hãy liên hệ hoặc theo dõi những nghiên cứu liên tục của chúng tôi về các coding agent:
→ X: https://x.com/ShayFrektman, https://x.com/yahav_ohana
→ LinkedIn: https://www.linkedin.com/in/shay-dahan, https://www.linkedin.com/in/yahav-ohana/
→ Substack: https://substack.com/@yahavohana
Liên hệ Softribution
Nếu bạn muốn được tư vấn chuyên sâu về kiến trúc agent, chiến lược định tuyến mô hình, hoặc cần mua giải pháp tối ưu hóa chi phí token và quản lý ngữ cảnh, đội ngũ Softribution sẵn sàng hỗ trợ. Vui lòng liên hệ Softribution để nhận tư vấn kỹ thuật, demo giải pháp và đề xuất triển khai phù hợp với nhu cầu của bạn — đội ngũ chuyên gia của chúng tôi sẽ giúp bạn thiết kế, triển khai và tối ưu hóa để đạt hiệu quả chi phí và vận hành tốt nhất. Để bắt đầu, hãy liên hệ qua form liên hệ trên trang web Softribution hoặc gửi yêu cầu tới kênh hỗ trợ của bạn.
