Tags
第 5 頁
Evaluation
Opik:LLM 產品上線後真正缺的不是更多 demo,而是 trace、eval 和監控回到同一個地方
Phoenix:LLM 產品真正需要的不是更多感覺,而是看得見的 trace、eval 和錯誤樣本
MLflow:AI 團隊真正缺的常常不是模型,而是能追蹤、評估、交付的生命週期
Langfuse 值得現在看嗎?AI 產品真正難的不是把模型接上去,而是你根本不知道它為什麼出錯
DSPy 值得現在看嗎?真正卡住 AI 產品的,常常不是 prompt 寫不好,而是你根本無法系統化把它變好