MSCE: 從記憶到技能 — 三層記憶治理讓 Agent 自主結晶可調用技能
一句話核心結論
現有 LLM agent 的記憶系統把過往軌跡當作被動上下文檢索出來再讓 agent 推理一次,而非轉化為可執行的能力。MSCE 提出三層記憶—技能共進化框架:L1 軌跡記憶保存可審計的步驟證據,L2 策略記憶從跨任務軌跡歸納出可復用的程序模式,L3 環境認知記憶抽象出環境結構與約束。只有證據鏈完整、預期收益為正、且近期證據穩定的 L2 策略才會被「結晶」為可調用技能。搭配反思加權價值回填(用步驟級自我反思的品質來分配終端獎勵),MSCE 在 EvoAgentBench 五領域全面最佳,軟體工程 +15.39pp,跨域遷移 +3.93pp,終身進化最高 +17pp。全部不需訓練基礎模型。
EvoAgentBench
五領域全面最佳:IR +9.23pp、Math +4pp、SE +15.39pp、KW +5.17pp
跨域遷移
平均 +3.93pp,證明學習的是可轉移的問題結構而非領域特化模式
終身進化
Math +17pp、SE +15.39pp、IR +13.84pp,成本反而下降
核心洞察:記憶不該只被讀,該被升級為技能
MSCE 指出了一個關鍵的設計缺陷:現有記憶系統的基本運作模式是「檢索 → 注入上下文 → 讓 LLM 再推理一次」。這導致三個問題:
- 重複推理浪費 token:每次遇到類似情境,都要把整段歷史軌跡塞進 context window 讓 LLM 重新思考,而非直接執行已知有效的步驟。
- 記憶與行動脫節:記憶庫裡堆滿了原始互動記錄,但這些記錄沒有被結構化為「觸發條件 → 程序步驟 → 驗證規則」的可執行格式。
- 缺乏品質治理:失敗的探索、盲目的嘗試、環境特定的雜訊全部混在一起,沒有機制區分哪些記憶值得保留、哪些該淘汰。
MSCE 的答案是:在記憶和技能之間插入一個治理層。記憶不直接變成技能,而是先經過三層抽象,只有通過證據、收益、穩定性三道閘門的策略才會被結晶。
技術架構:三層記憶 + 技能結晶 + 雙信號價值回填
三層記憶架構
- L1 軌跡記憶(Trace Memory):每步交互儲存 (狀態, 動作, 觀察, 自我反思, 步驟價值)。這是證據層——所有上層記憶和技能必須保留對 L1 證據的連結,確保可追溯、可審計。為控制儲存成本,L1 不保存完整原始輸出,而是歸一化後的摘要。
- L2 策略記憶(Policy Memory):從跨任務的 L1 軌跡中歸納出重複出現的程序模式。每個 L2 策略包含:觸發條件 phi、自然語言程序 pi、驗證/降級規則 kappa、適用邊界 B、以及支援的 L1 證據集。新策略在至少有 n_min 個不同任務的證據支持時才被歸納。
- L3 環境認知記憶(Environmental Cognition):抽象出環境的宣告性知識——實體與結構事實、因果規律、環境約束。與 L2 的「如何解決」不同,L3 描述「環境如何組織」。例如:Alpine 容器使用 musl libc 而非 glibc(這是 L3 事實);安裝系統依賴的正確指令是 apk add(這是 L2 程序)。
技能結晶三道閘門
L2 策略不等於技能。結晶為可調用技能需要通過三道檢查:
- 閘門一:證據鏈完整。來源 L2 策略必須保留支援的 L1 證據連結。
- 閘門二:預期收益為正。啟發式增益 G = 有用軌跡均值 - 無用軌跡均值,必須超過門檻 theta_G。
- 閘門三:近期穩定。最近的證據必須契合當前的觸發條件、程序和邊界,而非觸發大幅度改寫。
通過閘門的策略進入結晶流程:從正例證據歸納共同程序,從反例證據約束邊界,最終產出包含證據錨點、決策指引(偏好/反模式)、可靠性估計的可調用技能。每個草稿技能還要通過確定性驗證器檢查:schema 完整性、證據來源真實性、工具白名單合規、覆蓋率測試。
反思加權價值回填(Reflection-Weighted Value Backfilling)
長週期任務的核心難題:終端獎勵(成功/失敗)是稀疏的,無法直接告訴 agent 哪一步做對了。MSCE 的解法:
V(t) = alpha_t x R + (1 - alpha_t) x gamma x V(t+1)
其中 alpha_t 是反思權重——由自我反思的品質決定。如果某步的反思具體、因果明確、可轉移(如「pip install 失敗是因為 Alpine 缺少 python3-dev header」),alpha 就高,該步獲得較多終端獎勵分配。反之,空洞的反思(如「再試一次」)alpha 趨近於零,價值主要從後續步驟繼承。這個設計讓記憶建構偏向全域成功且局部可解釋的步驟。
實驗結果:五領域全面碾壓,消融揭露階層架構是關鍵
EvoAgentBench 主結果:MSCE 在全部五個領域達到最佳或並列最佳。與各領域最強 baseline 相比:
- 資訊檢索(IR):26.15% vs 16.92%(SkillFlow-Evolve),+9.23pp,成本持平
- 數學推理(Math):47.00% vs 43.00%(EverOS),+4.00pp,成本從 1745→1141 chars 大降
- 軟體工程(SE):53.85% vs 38.46%(多個 baseline),+15.39pp
- 程式實作(Code):61.54%(與 EvoSkill 並列),成本從 3.9→2.0 turns 砍半
- 知識工作(KW):53.45% vs 48.28%,+5.17pp
LoCoMo 長期對話記憶:Overall 61.23(最佳)、F1 49.89(最佳),單跳/多跳/時間推理三項全部第一。三層記憶架構在需要跨越多輪對話追溯事實的場景優勢顯著。
跨域遷移:在一個領域進化出的記憶和技能遷移到另一領域仍有效——平均 +3.93pp,六對遷移路徑全部正向。這證明 MSCE 學習的是可轉移的問題解決結構,而非領域特定的模板。
終身進化(Lifelong Evolution):隨著累積經驗從 p0 增長到 p100,Math +17pp、SE +15.39pp、IR +13.84pp。成本在 p25 短暫上升後持續下降到低於 p0。典型的「愈用愈聰明」曲線。
消融實驗五大發現:
- Flat Memory(最致命):取消三層架構後 IR -15.38pp、Math -16pp、SE -19.23pp、Code 成本從 2.0→5.3 turns。僅靠檢索過往經驗遠遠不夠。
- w/o L3 環境認知:Math 成本飆升 28%(1141→1461 chars),缺少環境結構知識導致更多盲目探索。
- w/o 價值校準:移除價值過濾後各領域均有下降,SE -3.85pp。
- w/o 反思加權:將反思權重設為均勻後 Math -7pp、SE -7.7pp,證明反思品質加權對價值分配至關重要。
- w/o 技能結晶:僅保留記憶不結晶技能,成本全面暴漲(Math +37%、SE +44%),成功率也下降。
對 DKY / Hermes 的啟發
MSCE 跟 Hermes 現有架構有驚人的對應關係,三個直接啟發:
- 三層記憶 vs Hermes 的 session / fact_store / skill:MSCE 的 L1 對應 session traces、L2 對應 fact_store 中的程序性記憶、L3 對應環境配置知識(如 deploy-verify skill 中的站點對照表)。目前 Hermes 這三層混在一起,MSCE 證明了分層治理的顯著效益——Flat Memory 的 15-19pp 劣化是最直接的證據。
- 技能結晶閘門 vs Hermes 的 skill creation:Hermes 目前透過 sleep consolidation 被動建立 skill,沒有「證據鏈完整、預期收益為正、穩定性」三道閘門。MSCE 的 gate-based promotion 可以作為 sleep consolidation 的升級方向。
- 反思加權價值回填 vs 無回饋 loop:Hermes 目前沒有從任務成功/失敗回傳價值信號給內部記憶的機制。MSCE 的雙信號架構提供了一個輕量級方案:不需要 RL 訓練,只需在任務結束後跑一次 value backfilling 即可更新記憶權重。
限制
- 目前依賴 LLM(GPT-4o)做 L2 策略歸納和 L3 環境認知抽象提示,這些輔助 prompt 的成本未在主要實驗中單獨報告
- 技能結晶的增益函數 G 是啟發式的(softmax 加權均值差),不是因果效果估計,可能在複雜環境中誤判
- L3 環境認知的抽象品質高度依賴 prompt 設計(論文在附錄花了大量篇幅規範 L3 的輸出格式)
- 目前僅在模擬 benchmark 上驗證,尚未在真實部署環境中測試
- 跨域遷移測試僅 6 對路徑,域間差異較大時效果未知