Tags
第 4 頁
VLLM
llm-d 想把 Kubernetes 變成 LLM 推理控制層,但別把它當輕量部署工具
NVIDIA Dynamo 值得現在看嗎?推理成本真正麻煩的不是模型跑不起來,而是多 GPU 叢集不會自己協調
vLLM:開源模型上線真正難的,不是跑出第一個 token,而是把吞吐、延遲和成本一起撐住
不是每次都重算:LMCache 怎麼把 LLM 推理裡最貴的 prefill 省下來