Tags
第 3 頁
Post-Training
AReaL:agentic RL 開始從研究腳本,長成可以接外部 agent 的訓練基礎設施
TRL:不是又一個微調工具,而是把 LLM 後訓練變成可重複工程流程的開源底座
Unsloth 值得現在看嗎?微調門檻確實降下來了,但別因此以為每個團隊都該自己養模型