Tags
第 4 頁
LLM Evals
promptfoo 快評:LLM 評測要進 CI,但不要把分數當成品質保證
DeepEval:AI 產品不能只靠感覺驗收,LLM 評測正在變成工程團隊的測試層
Ragas:當 AI 團隊不想再靠 vibe check 上線,這套開源 eval 框架補的是哪一段
每次改 prompt 都像在拆盲盒,Promptfoo 想先把 AI 功能變成可測試的產品