31/07/2026
連模型評分都可以不靠真人,完全自動化?!
過去 Arena AI 的評測是靠真實使用者兩兩比較後投票,累積出排名。好處是貼近真實使用情境,缺點是票要慢慢累積,新模型上線往往得等好幾天才有意義的分數。
AutoEval 的作法是訓練一個獎勵模型,讓它學會人類的偏好,再由它代替真人投票,一小時內就能產出排名。另一個好處是彈性,出題的 prompt 由 Arena 自己控制,可以快速針對特定領域評測。
這個獎勵模型是用 Arena 自家數百萬組人類兩兩比較的資料訓練出來的,讓它的打分排序跟人類判斷對得起來。
Arena 宣稱他們的文字獎勵模型在預測人類偏好上,比先進模型當裁判還準八到十個百分點。因為 Arena 上的題目本身就難,參賽的又都是強模型,常常沒有哪一邊全面壓倒性地好,這時候 LLM 裁判就卡住了,而用真實偏好資料訓出來的獎勵模型還抓得住人類到底偏好什麼。
不過使用者覺得什麼叫好回應,會隨著期待和使用情境一直變。訓練上要同時吃歷史資料維持穩定,又要跟上近期的趨勢,這不是訓練一次就結束的事。
目前 AutoEval 已涵蓋文字、視覺、圖像生成和程式碼。榜上會標示哪些分數來自 AutoEval,等真人票夠了再更新成正式分數。