在 AI 代理人開發的最新演進中,「Agent = Model + Harness」已確立為取代笨重黑盒框架的核心架構典範。 過去兩年間,開發社群經歷了從過度封裝的多代理人框架到輕量化架構的深刻反思:當開發者試圖將複雜的真實業務交給黑盒框架處理時,往往會遭遇除錯困難、狀態失控與 API 成本爆炸的嚴峻挑戰。由學界研究者與開源先鋒(如 Xudong Han 等人)所提倡的「Model + Harness」理念,將模型視為通用的推理引擎,而將確定性的工具路由、狀態機維護、沙盒執行與評估器封裝為外部外骨骼(Harness)。本文將深入拆解如何將企業專家的標準作業流程(SOP)轉化為模組化的 AI Skills,並結合 DeepSeek Harness 與 TerminalBench 等真實基準測試,為你提供高可靠度的代理人系統建構藍圖。

Agent = Model + Harness 雙層架構模型:將無狀態基底推理引擎與有狀態外部外骨骼完全解耦

1. 典範轉移:為什麼「Agent = Model + Harness」正在淘汰笨重的黑盒框架?

在早期的 AI Agent 探索中,產業普遍流行採用高度抽象的巨型框架。這些框架試圖用一套龐大的類別繼承體系包辦記憶體、對話路由與工具呼叫,卻在投入實際生產時暴露出致命弱點:

  • 黑盒封裝導致除錯困難:當代理人在第十步推理出現幻覺或工具調用錯誤時,封裝過深的框架往往無法讓工程師精確介入中間狀態,導致整條執行鏈崩潰。
  • 上下文膨脹與無效消耗:通用框架傾向於在每一輪對話中塞入全量系統提示詞與所有工具定義,造成嚴重的上下文污染與 Token 浪費。
  • 缺乏確定性防護網:純粹依賴 LLM 的自主決策容易引發指令漂移,缺乏外部確定性規則的約束。

現代代理人架構因此回歸清晰的責任分工:模型專注於即時語義理解與步驟推理,而外骨骼(Harness)負責提供確定性的執行環境與防護邊界

黑盒巨型框架 vs. 現代 Model + Harness 架構:
黑盒框架架構  ──► [單一巨型抽象層 (包辦記憶、規劃、調度)] ──► 無法精確除錯、黑盒死鎖與高成本
Model + Harness ──► [基底模型 (純推理引擎)] + [外骨骼 Harness (SOP 技能庫 / 狀態機 / 驗證閘門)] ──► 高可控性、高容錯與極致效能

2. SOP 到 Skills 的系統化轉型:如何將專家工作流解構成可執行的原子模組?

要建構穩健的 Harness,核心關鍵在於如何將人類專家的標準作業流程(SOP)轉換為 AI 能夠精準執行的 Skills(模組化技能)。這套轉型方法包含三個關鍵階段:

1. SOP 解構與原子化封裝(Atomization)

將複雜的端到端任務(例如「季度財務分析報告」或「全端功能開發」)拆解為具備明確輸入、輸出與前置條件的獨立子任務。每個子任務被封裝為一個獨立的 Skill 模組,包含專屬的提示詞約束、執行腳本與 Schema 驗證。

2. 漸進式揭露(Progressive Disclosure)

傳統做法是在系統開頭載入所有工具,而先進的 Harness 採用漸進式揭露機制:模型在初期的規劃階段僅能看見粗粒度的技能清單;只有當模型決定調用特定 Skill 時,系統才會將該 Skill 的詳細參數定義與執行範例動態注入上下文。

3. 確定性驗證閘門(Deterministic Quality Gates)

每個 Skill 執行完畢後,Harness 會啟動不依賴 LLM 的確定性程式碼檢查(如語法 Lint、單元測試、正規表達式校驗)。唯有通過閘門驗證的結果才會進入下一步,徹底阻斷錯誤擴散。

SOP 轉化為 AI Skills 系統化生命週期:從專家業務流程到具備閘門驗證的模組化技能庫
架構維度 傳統 Prompt / 黑盒框架模式 模組化 SOP Skills + Harness 模式 系統可靠度提升指標
工作流控制 依賴單一超長 Prompt 自主發揮 嚴格依照專家 SOP 狀態機逐步推進 消除 80% 以上的多步執行指令漂移
工具載入機制 初始化時全量靜態注入上下文 根據任務階段動態漸進式揭露 降低 50% 以上的上下文 Token 雜訊
錯誤修復能力 報錯後依賴模型無序重試 Harness 本地攔截並提供結構化錯誤回饋 大幅提升單元測試與程式碼編譯通過率
維護與擴展性 修改單一提示詞引發全域連鎖反應 各 Skill 模組完全解耦,可獨立熱插拔 支援多團隊並行開發與個別版本控制

3. DeepSeek Harness 與開源基準測試:從 TerminalBench 看開源逆襲

在以 DeepSeek 為代表的頂級開源權重模型於推理能力上大幅躍升的背景下,業界評估 AI 的標準已從傳統的靜態選擇題(如 MMLU)全面轉向真實環境中的代理人基準測試:

  • TerminalBench:評估代理人在真實 Linux 終端環境中執行 Shell 指令、管理套件、配置網路與修復系統故障的實際操作能力。
  • DeepSWE / AutomationBench:測試模型在龐大軟體儲存庫中自主定位 Issue、修改跨檔案代碼並通過 CI 測試的全流程工程能力。

實測數據表明:當開源模型(如 DeepSeek-R1 / V3)搭配精心設計的專屬 Harness(包含高頻率工具中繼、語義快取與自定義沙盒環境)時,其在終端自動化與軟體工程任務中的綜合表現已能媲美甚至超越昂貴的閉源模型,且推論成本僅為閉源 API 的十分之一。

真實環境 Agent 基準測試與開源模型逆襲:TerminalBench、DeepSWE 與成本效能曲線
SOP 轉化為 AI Skills 的完整生命週期:
專家業務 SOP ──► [原子化解構] ──► [獨立 Skill 模組定義] ──► [漸進式動態加載] ──► [確定性閘門驗證] ──► 交付可靠結果

4. 開發者控制權與架構實踐:建構高容錯、低成本的企業級自主代理人

要在企業與個人專案中實踐「Model + Harness」架構,開發者應掌握以下三個實務設計原則:

原則一:狀態與推理完全解耦(Stateless Model, Stateful Harness)

模型本身保持無狀態特性,所有的對話歷史、檔案指標、變數快取與任務進度皆由 Harness 本地資料庫或狀態機進行管理。當上下文窗口接近極限時,Harness 負責自動執行語義壓縮或記憶體滾動,確保系統能無上限持續運作。

原則二:分離評估器與執行器(Evaluator-Optimizer Separation)

切勿讓執行任務的同一個模型實例兼任自我評估工作。Harness 應調度獨立的檢查節點或執行確定性腳本進行交叉比對,避免模型陷入「自我肯定」的認知盲區。

原則三:為錯誤復原建立標準退避路徑

當外部 API 超時、資料庫查詢失敗或終端指令返回非零狀態時,Harness 應具備自動退避、降級執行(Fallback)與上下文重置策略,而非任由模型在死迴圈中反覆耗盡 Token。

5. 常見問題(FAQ)

Q1:「Model + Harness」與過去微調(Fine-tuning)模型有何不同?

微調著重於改變模型的內部權重以適應特定語氣或知識領域;而「Model + Harness」著重於在模型外部建構完善的執行環境、工具協定與驗證機制。在實務上,優秀的 Harness 架構往往比耗時費力的微調能帶來更高、更具確定性的任務成功率。

Q2:如何判斷一項業務 SOP 是否適合轉化為 AI Skill?

具備「明確的輸入參數」、「可量化的驗證標準」以及「清晰的步驟邊界」之業務流程最適合轉化。若該流程包含過多高度主觀且無法透過客觀指標檢驗的決策,則建議保留人類專家介入節點(Human-in-the-loop)。

Q3:在 Model + Harness 架構中,如何兼顧執行速度與 Token 成本?

關鍵在於落實漸進式揭露與本地中介代理(如本地快取、精簡錯誤碼提煉)。透過僅在必要時載入相關技能定義,並在本地攔截無效日誌,能在維持極高推理速度的同時節省過半的 API 開銷。

Q4:DeepSeek Harness 能否直接遷移至其他開源或閉源模型?

可以。Harness 的本質是一套遵循標準協定(如 Tool Calling、MCP 協定)的通用執行外骨骼。只要模型具備基礎的指令遵循與結構化輸出能力,開發者即可隨時無縫切換底層推理模型。

權威引用

Author Insight

從 Prompt Engineering 到 Context Engineering,再到如今確立的 Harness Engineering,AI 應用的核心競爭力正在從「如何向模型提問」轉變為「如何為模型建構最合適的運行世界」。模型是強大的引擎,但若沒有底盤、懸吊與傳動系統,車輛依然無法前進。將專家 SOP 模組化為精確的 Skills,並用確定性的外骨骼約束隨機性,正是將生成式 AI 從玩具推進至企業級核心生產力工具的唯一途徑。

我們團隊持續深耕企業級 AI Agent 架構設計、Harness 工程實務與 SOP 模組化導入方案。如果你正在評估團隊的代理人工作流或規劃新一代 AI 系統架構,歡迎與 Tenten 團隊預約諮詢

Share this post
Erik (EKC)

With over 20 years of experience in technology, and the startup industry, I am passionate about AI and driving innovation. Keeping the engine running

Loading...