在实际部署中,还需要考虑 Worker 的弹性伸缩策略。与普通 HTTP 服务的 CPU/内存型 HPA 不同,AI 推理的 Worker 瓶颈通常在等待模型响应(I/O 等待),而非 CPU。
app.json): { "compilerOptions": { "baseUrl": ".
appendQr_normal{float:left;} .appendQr_normal img{width:100px;} .
Query planner 改进: 对于 EXCEPT、INTERSECT 和 UNION,始终使用排序合并算法,因为这几乎总是比使用哈希表更快。
2 万 Token 降至 8.9 万,减少 12.7%; Terminus-2 从约 5.
90 ns 0.82 0 B FastPathToTask 12.85 ns 0.