Tags
第 5 頁
GPU
TensorRT-LLM:開源模型推理要榨出效能,最後常常會回到 NVIDIA 生態的硬底層
vLLM:開源模型上線真正難的,不是跑出第一個 token,而是把吞吐、延遲和成本一起撐住
SkyPilot 把 AI 團隊最容易失控的算力調度,拉回同一個控制面
Unsloth 值得現在看嗎?微調門檻確實降下來了,但別因此以為每個團隊都該自己養模型
SGLang 值得現在看嗎?開源模型真正難的不是跑起來,而是撐住延遲、吞吐與成本