AI大模型與智能體的實踐比較
越來越多編程任務有智能體執行,但是如何選擇大模型和智能體平台,不少人只是靠評測結果。但是許多評測結果在實際工作中並不一致。
原來,不少評測只屬於考試題,並不是真實的應用個案。如果大模型利用這些考試題訓練,看似編碼能力超強,實戰工作中表現,可能不如評測結果。
Databricks利用了大量人工智能作編碼,而且是最早自行訓練大模型的IT企業,決定利用本身的真實個案,測試不同大模型和智能體配合,所獲得的工作成果,以及性價比等數據,不再倚賴公開的評測。
結果今次評測獲得了驚人的結論,並且在網站上公布,最具性價比的模型竟然是智譜 GLM 5.2,另外亦有顯示 Harnessing 架構對於性價比,以及工作質素質素有重大影響,首選harnessing平台竟然是較為冷門的 Pi。
2026年7月8日,Databricks 發布了內部自研代碼 Agent 基準測試報告。隨著 AI 編碼工具的爆發式增多,Databricks 團隊需要基於自身真實工程場景,對比多款模型、運行框架(harness)的任務通過率與單任務成本,找出性價比最優組合,提升工程師 AI 編碼效率。Databricks 放棄了 SWE-Bench 等公開基準,自建採用內部多語言、複雜業務代碼的評測體系。今次評測對象覆蓋了多種不同語言,包括 Python/Go/TS/Scala/Rust 等十多種語言的百萬行內部代碼庫,全部任務都是源自真實工程師 PR,人工校驗任務與標準答案,保證評測可信度。
GLM 成性價比之王
1. 優質性價比模型混合覆蓋最優邊界(Pareto 前沿):最高性能 AI 大模型梯隊同時包含 OpenAI、Anthropic 閉源模型與開源模型,由於單一AI廠商無法兼顧成本與效果,現實環境中需混合選型才能拿到頂尖編碼能力。
2. 開源 GLM 5.2 竟然達到頂級閉源模型水準:GLM 5.2 與 Claude Opus 4.8 任務通過率持平,但單任務成本僅 $1.28 美元,低於 Opus 的 $1.94;兩個模型都同時搭配了同一套 Pi 輕量 harness(代理執行框架),並不是原生 Claude Code 框架,這是非常關鍵的前提,作為日常開發主力模型,適配高難度編碼任務,由內部工程師實測反饋證明穩定可靠。 其實如果 Opus 用的是 anthropic 本身的 Claude Code 框架,而不是 Pi,單任務成本會更高,兩者差距會更大;因為 Pi 壓縮了上下文輪次、減少多輪調用,大幅壓低總 token 的消耗量,因此測試環境其實是對 opus 較為有利。
3. 所以,利用單 Token 定價無法代表真實任務總成本:模型推理效率差異極大,例如 Sonnet 5 單 Token 價格比 Opus 4.8 便宜 1.7 倍,但推理時消耗 1.9 倍 Token,最終單任務成本更高,價錢雖然平,更加不化算、通過率低了 6 個百分點;大模型推理效率高,反而整體更省錢,必須以任務維度做基準而非僅看每個 Token 的單價。
4. 研究也發現運行框架(Harness)對成本、性能影響巨大:同一模型搭配不同框架,單任務成本最高相差 2 倍以上;輕量化 Pi 框架單次輸入上下文僅為原生 Claude Code/Codex 的 1/3 左右,精簡上下文、減少調用輪次,大幅降低成本開銷,且最重要的是,任務通過率幾乎無損失。為此 Databricks 開發 Omnigent 工具,實現模型與框架一鍵切換。
模型三大能力分層
依據任務通過率劃分清晰梯隊,匹配不同複雜度開發場景:
1. 第一梯隊(82%-90% 通過率,高難度開發):Opus 4.8、GLM 5.2、GPT 5.5,適合架構設計、複雜 bug 修復等高難度需求;成本最高,但處理深度任務穩定性最強。
2. 第二梯隊(71%-82% 通過率,常規業務開發):Sonnet 4.6、GPT 5.5 中等配置,性價比均衡,適合絕大多數日常業務編碼。
3. 第三梯隊(51%-60% 通過率,簡單運維/配置修改):GPT 5.4-mini、Haiku 4.5,成本極低,僅用於開關配置、簡單腳本、參數修改等低複雜度任務。
今次的內部工程師編碼任務分布:中等複雜度占 61.1%,高難度 12.1%,低難度 19.3%,簡易任務 7.6%;過去 Databricks 團隊統一使用高價頂級模型,自研究顯示有優化成本空間。
Databrick 認為自建基準,捨棄公開基準
1. 首先最重要的是,公開基準數據集會流入模型訓練集,存在數據洩露,測試結果失真。
2. 公開數據集以 Python 項目為主,無法覆蓋 Databricks Scala/Rust/Protobuf/Bazel 等多棧複雜代碼。
3. 自建基準基於內部真實 PR,測試用例貼合業務規範,優化落地不會損害開發效率。
基準構建測試完整方法
1. 數據源篩選:從近期合並 PR 中篩選合格樣本,過濾 AI 生成、舊代碼、無完整測試用例、跨多模塊複雜變更;僅僅保留人工編寫、並且帶有完備測試、模塊完全獨立、覆蓋Full stack業務的 PR。
2. 任務標準化處理:完全刪除 PR 內解決方案,僅保留需求的目標、並且約束條件作為 Prompt;拆分代碼文件與獨立測試集,屏蔽標準答案線索;重寫測試用例:摒棄精確字符串匹配,改為校驗代碼行為邏輯,配合模型多樣化的方案。
3. 防止作弊防護:早期發現 Agent 可通過 Git 日誌回溯原始 PR 標準答案,因此評測時完全隔離倉庫 Git 歷史,杜絕大模型走捷徑。
4. 今次的客觀評分規則:完全不使用 LLM 裁判判定正誤,直接運行預留測試集,全部用例通過才算任務 Pass,保證評判客觀。
Databricks 後續規劃
1. 持續擴充高難度評測任務,迭代更新基準數據集。
2. 利用 Unity AI Gateway、Omnigent 實現任務智能路由,自動匹配對應複雜度的最優模型與框架。
3. 避免廠商鎖定,保持模型、框架靈活切換,基於真實代碼數據持續優化 AI 編碼成本與效率。
4. 進一步完善智能路由,讓開發人員低成本使用頂尖編碼 Agent。
模型不是越貴越好
評測方案可被所有擁有存量 PR 的企業複製使用,無需依賴公開數據集;Databricks 本身已基於測試結果,調整內部的模型調用策略:通過 Omnigent 將簡單任務分流至低成本輕量模型,複雜任務啟用 GLM 5.2 或 Opus,搭配 Pi 輕量化運行框架,顯著降低 AI 編碼成本、提升工程效率。
有關評測結果可參考以下網址: https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase此外,Databricks 亦開放了 Omnigent 引擎(meta-harness 調度框架),不只是單純router,而是Meta-Harness(元執行框架),路由只是其中一項功能,亦可包裝業務邏輯,作不同配置方便做對照實驗(A/B 測試不同 LLM):。
Databricks 在2026年6月正式對外公源的Omnigent 採用 Apache 2.0 開源。原始程式碼放在 GitHub:omnigent-ai/omnigent、本地下載部署、自行二次開發、作用包括了可統一包裝 Pi、Claude Code、Codex、GLM 等各類Agent,一手包辦路由、上下文壓縮、成本管理、沙箱隔離等,因此以上的測試可以在企業內部複製和驗證上述結果。
