Theo dõi và giám sát AI của Beating AI, Cline đã tính toán chi phí tự lưu trữ Kimi K2.6 trong môi trường sản xuất thực tế. Việc xử lý 5.83Bỷ token mỗi tháng qua API tốn xấp xỉ 185.000 USD. Chạy 16 GPU NVIDIA B200 ở công suất tối đa cho lưu lượng cơ sở, đồng thời định tuyến các yêu cầu còn lại qua API, giúp giảm hóa đơn xuống còn 166.000 USD—chỉ tiết kiệm khoảng 10%.
Cline ước tính rằng lập lịch GPU động có thể giúp tăng mức tiết kiệm lên 22%-25%, và tối ưu thêm có thể đạt 35%-40%, dù các chiến lược này vẫn chưa được kiểm chứng trong sản xuất. Công ty kết luận rằng tự lưu trữ chỉ thực sự khả thi về mặt kinh tế khi chi tiêu API hằng năm vượt 500.000 USD đến 2 triệu USD; dưới ngưỡng này, chi phí hạ tầng và kỹ thuật thường lớn hơn phần tiết kiệm.