Boost hiện đã có bản xem trước công khai

Boost hiện đã có bản xem trước công khai

Boost Launch - 863x300

Hôm nay, chúng tôi vui mừng thông báo rằng Boost đã chính thức rời giai đoạn beta và bước vào public preview.

Sau nhiều tháng phát triển, thử nghiệm và tái cấu trúc bên trong bộ phận R&D của JFrog, Boost đã sẵn sàng cho cộng đồng. Nếu bạn đang gặp giới hạn token, chi phí khó lường hoặc tình trạng sử dụng mất kiểm soát từ các AI agent, Boost được thiết kế cho bạn.

Nó đã giúp các đội của chúng tôi giảm chi phí token trong khi vẫn duy trì hiệu năng. Giờ đây, chúng tôi cung cấp công cụ này cho cộng đồng miễn phí, để bạn có thể trải nghiệm tác động tương tự trong quy trình phát triển của mình.

Dưới đây là toàn bộ câu chuyện về hành trình của chúng tôi.

Hóa đơn đã khiến chúng tôi chạm tới giới hạn

Chúng tôi mở dashboard tính phí và nhìn thấy điều mà không kỹ sư nào muốn thấy – hóa đơn Cursor cá nhân vượt quá $700 cho chưa tới 2.000 yêu cầu. Các phiên Claude Code vượt mức hơn $1.700, và ngay lập tức xuất hiện email công ty với tiêu đề: “AI Spend Guardrails Starting Feb 1”.

Chúng tôi đang tiêu tiền như rót, và liên tục gặp thông báo “API limit exceeded” vì các agent tiêu token như nước.

Là những kỹ sư đã dành cả sự nghiệp tại JFrog tối ưu hóa hệ thống build và loại bỏ lãng phí trong pipeline phát triển, chúng tôi không chấp nhận lãng phí. Không trong build phần mềm, và không trong chi phí AI. Vì vậy chúng tôi làm điều những kỹ sư thường làm: đi tìm nguồn gốc vấn đề.

90% chi phí bạn đang trả là nhiễu

Đây là phát hiện của chúng tôi: các coding agent không phải kém, mà chúng đang bị quá tải bởi ngữ cảnh không liên quan.

Input context hiện chiếm khoảng 70% hóa đơn AI của bạn. Ở mỗi lượt prompt, agent đang tiêu thụ lượng lớn văn bản, phần lớn trong đó không cần thiết. Chúng tôi phát hiện agent đọc tới 10.000 dòng mã chỉ để sử dụng 10 dòng. Hơn 90% những gì bạn trả tiền bị đọc một lần rồi bỏ đi.

Chúng tôi lần ra lãng phí này từ ba thói quen cụ thể:

1. Thác log kiểm thử
Khi một test thất bại, phản xạ là stream toàn bộ output log thô tới agent. Chúng tôi theo dõi một tình huống thật, nơi một agent được cung cấp 847 dòng log pytest. Mô hình đã tiêu token đắt giá để phân tích hàng trăm dòng “PASSED”, cảnh báo dependency và metadata môi trường, trong khi thứ nó thực sự cần chỉ là 9 dòng: traceback lỗi chính xác. Chúng tôi đã phát triển một bộ tinh lọc log (log-distiller) loại bỏ những dòng không liên quan trước khi chúng rời khỏi máy của bạn, giảm payload hơn 80%.

2. Thói quen grep & tìm kiếm mù quáng
Một lệnh grep cơ bản cho một hàm phổ biến như getUser trả về một bức tường kết quả lộn xộn: cache bị minify, tài liệu cũ, changelog, mocks — tất cả xếp chồng lên nhau. Trong thử nghiệm, một truy vấn đơn lôi về 119 kết quả. Agent đọc lại cả 119 kết quả ở mỗi lượt prompt chỉ để tìm ra một mục cần thiết. Chúng tôi giải quyết vấn đề này bằng một binary hỗ trợ LSP, cung cấp tìm kiếm có ngữ cảnh ngôn ngữ cho agent, giảm đáng kể lãng phí token do tìm kiếm và tăng tốc các tác vụ coding.

3. Vòng lặp ảo giác do cắt ngắn (Truncation Hallucination Loop)
Nhiều script tiết kiệm token cơ bản cố gắng cắt ngắn output terminal một cách quyết liệt. Nhưng chúng tôi chứng kiến điều này tạo ra vấn đề mới: agent quên ngữ cảnh. Trong thử nghiệm, khi script che quá nhiều ngữ cảnh, agent mất phương hướng, hoảng loạn và rơi vào vòng lặp — chạy cùng một lệnh ls hoặc cat tới sáu lần chỉ để xác minh môi trường. Agent tiêu nhiều token hơn cho các kiểm tra lặp đi lặp lại so với lượng token được tiết kiệm bằng cách cắt log. Nhận thức này giải thích vì sao chúng tôi không chỉ xây một bộ lọc mù; chúng tôi thiết kế một kiến trúc giúp agent hiểu lớp tối ưu hóa, ngăn chặn vòng retry trước khi nó bắt đầu.

Bài học rút ra khi xây dựng bản beta

Phiên bản đầu tiên của chúng tôi đơn giản, dựa trên một binary nhẹ tên boost bọc mọi lệnh agent.

Trước đây chúng tôi chạy các lệnh agent tiêu chuẩn như:


ls -l
kubectl apply -f ...
docker run ...


Bây giờ, chúng tôi thêm chức năng boost vào cùng cấu trúc lệnh cơ bản:


boost ls -l
boost kubectl apply -f ...
boost docker run ...

Điều này cho chúng tôi tầm nhìn đầy đủ về mọi token chảy qua hệ thống. Nhưng bản beta dạy chúng tôi ba vấn đề nhanh chóng:

Vấn đề bảo mật: Khi mọi lệnh đều được tiền tố bằng boost, môi trường agent coi chúng là một chương trình duy nhất. Một lần click “Always Allow” cho boost ls -l có thể đồng nghĩa cho phép mọi thao tác, bao gồm boost rm -rf /. Chúng tôi phải thiết kế lại hoàn toàn cách xử lý quyền.

Vấn đề tiết kiệm ảo: Nhiều công cụ trên GitHub tuyên bố giảm token 90%. Phần lớn hoặc làm hỏng agent, hoặc đo lường sai. Nếu bạn chặn output trước khi một grep sẽ lọc và lấy công credit cho thứ grep đáng lẽ đã loại bỏ, đó không phải là tiết kiệm thực sự. Chúng tôi cần cắt đúng token, chứ không chỉ cắt nhiều nhất.

Vấn đề cắt ngắn: Cắt quá mạnh làm agent mất tác dụng. Chúng quên ngữ cảnh giữa chừng, ảo tưởng sửa lỗi và rơi vào vòng xoáy. Mục tiêu không phải là tối thiểu token mà là agent chính xác sử dụng ít token hơn.

Những gì chúng tôi đã phát hành

Giải pháp chúng tôi chọn giữ thiết kế tinh gọn, với hai khả năng mang quyền kiểm soát trở lại cho agent và nhà phát triển:

boost skill – Một system prompt tối giản dạy agent chính xác boost là gì, hoạt động ra sao và cách tương tác với môi trường một cách thông minh. Agent hiểu lớp tối ưu hóa thay vì bị thao túng thầm lặng bởi nó.

boost retrieve – Nếu agent cần dữ liệu bị lọc ra, nó chạy boost retrieve. Lệnh này ngay lập tức lấy lại output đầy đủ, chưa chỉnh sửa của lệnh đã thực thi gần nhất từ lịch sử session. Không có gì bị mất vĩnh viễn, chỉ được lưu trữ hiệu quả cho tới khi cần.

Kiến trúc này giữ cho agent vẫn thông minh. Chúng luôn có thể lấy lại thông tin cần thiết, và chỉ những token quan trọng mới bị tiêu thụ.

Kết quả ấn tượng: Tiết kiệm 100 tỷ token

Chúng tôi không phát triển trong phòng thí nghiệm kín. Chúng tôi triển khai Boost dần dần khắp bộ phận R&D của JFrog với hơn 1.000 kỹ sư, và để dữ liệu dẫn đường cho mọi quyết định. Chúng tôi theo dõi tần suất agent cần boost retrieve, công nghệ nào đòi hỏi nhiều ngữ cảnh nhất, và nơi chúng tôi có thể cắt giảm an toàn.

Kết quả vượt ngoài mong đợi.

Chúng tôi mở rộng tổng mức tiết kiệm token từ vài tỷ lên hơn 100 tỷ token được tiết kiệm, đồng thời làm cho các coding agent nội bộ nhanh hơn, gọn hơn và chính xác hơn trước.

Một điều chúng tôi muốn nhấn mạnh: Boost chỉ thu thập những telemety cấp cao như số lượng token và lỗi tổng thể để cải thiện năng suất. Chúng tôi không bao giờ nhìn thấy, lưu trữ hoặc truyền mã nguồn hay các cuộc hội thoại. Quyền riêng tư không chỉ là một mục tick với chúng tôi, mà là tâm điểm của ứng dụng.

Trải nghiệm Boost ngay hôm nay

Chúng tôi rất tự hào về Boost. Thật ấn tượng khi thấy một công cụ bắt đầu như dự án cuối tuần đã phát triển thành một động cơ tối ưu hóa đạt chuẩn doanh nghiệp, được thử nghiệm trong một trong những tổ chức phát triển phần mềm lớn nhất thế giới.

Nếu bạn từng rùng mình khi mở dashboard tính phí token AI, gặp giới hạn API giữa chừng, hoặc chứng kiến agent đốt toàn bộ ngân sách context cho một log kiểm thử, Boost được xây cho bạn.

Boost hiện ở giai đoạn public preview và miễn phí. Bắt đầu tại boost.jfrog.com.

Hãy giữ cho các agent trung thực và pipeline luôn vận hành trơn tru.

Liên hệ Softribution ngay hôm nay để được tư vấn chuyên sâu hoặc mua giải pháp — đội ngũ chúng tôi sẵn sàng hỗ trợ triển khai, tích hợp và tối ưu hóa Boost cho tổ chức của bạn.

Share this post