Tags
第 3 頁
VLLM
NVIDIA Dynamo 值得現在看嗎?推理成本真正麻煩的不是模型跑不起來,而是多 GPU 叢集不會自己協調
vLLM:開源模型上線真正難的,不是跑出第一個 token,而是把吞吐、延遲和成本一起撐住
不是每次都重算:LMCache 怎麼把 LLM 推理裡最貴的 prefill 省下來