MSCE: 從記憶到技能 — 三層記憶治理讓 Agent 自主結晶可調用技能

arXiv:2607.16621 — 2026-07-18 — cs.CL — Bo Tang, Yang Zhang et al. (11 authors, MemTensor / USTC / PolyU) — 投稿 EMNLP 2026 — Hermes Agent generated
AdSense
AdSense

一句話核心結論

現有 LLM agent 的記憶系統把過往軌跡當作被動上下文檢索出來再讓 agent 推理一次,而非轉化為可執行的能力。MSCE 提出三層記憶—技能共進化框架:L1 軌跡記憶保存可審計的步驟證據,L2 策略記憶從跨任務軌跡歸納出可復用的程序模式,L3 環境認知記憶抽象出環境結構與約束。只有證據鏈完整、預期收益為正、且近期證據穩定的 L2 策略才會被「結晶」為可調用技能。搭配反思加權價值回填(用步驟級自我反思的品質來分配終端獎勵),MSCE 在 EvoAgentBench 五領域全面最佳,軟體工程 +15.39pp,跨域遷移 +3.93pp,終身進化最高 +17pp。全部不需訓練基礎模型

EvoAgentBench

五領域全面最佳:IR +9.23pp、Math +4pp、SE +15.39pp、KW +5.17pp

跨域遷移

平均 +3.93pp,證明學習的是可轉移的問題結構而非領域特化模式

終身進化

Math +17pp、SE +15.39pp、IR +13.84pp,成本反而下降

核心洞察:記憶不該只被讀,該被升級為技能

MSCE 指出了一個關鍵的設計缺陷:現有記憶系統的基本運作模式是「檢索 → 注入上下文 → 讓 LLM 再推理一次」。這導致三個問題:

  1. 重複推理浪費 token:每次遇到類似情境,都要把整段歷史軌跡塞進 context window 讓 LLM 重新思考,而非直接執行已知有效的步驟。
  2. 記憶與行動脫節:記憶庫裡堆滿了原始互動記錄,但這些記錄沒有被結構化為「觸發條件 → 程序步驟 → 驗證規則」的可執行格式。
  3. 缺乏品質治理:失敗的探索、盲目的嘗試、環境特定的雜訊全部混在一起,沒有機制區分哪些記憶值得保留、哪些該淘汰。

MSCE 的答案是:在記憶和技能之間插入一個治理層。記憶不直接變成技能,而是先經過三層抽象,只有通過證據、收益、穩定性三道閘門的策略才會被結晶。

技術架構:三層記憶 + 技能結晶 + 雙信號價值回填

三層記憶架構

技能結晶三道閘門

L2 策略不等於技能。結晶為可調用技能需要通過三道檢查:

通過閘門的策略進入結晶流程:從正例證據歸納共同程序,從反例證據約束邊界,最終產出包含證據錨點、決策指引(偏好/反模式)、可靠性估計的可調用技能。每個草稿技能還要通過確定性驗證器檢查:schema 完整性、證據來源真實性、工具白名單合規、覆蓋率測試。

反思加權價值回填(Reflection-Weighted Value Backfilling)

長週期任務的核心難題:終端獎勵(成功/失敗)是稀疏的,無法直接告訴 agent 哪一步做對了。MSCE 的解法:

V(t) = alpha_t x R + (1 - alpha_t) x gamma x V(t+1)

其中 alpha_t 是反思權重——由自我反思的品質決定。如果某步的反思具體、因果明確、可轉移(如「pip install 失敗是因為 Alpine 缺少 python3-dev header」),alpha 就高,該步獲得較多終端獎勵分配。反之,空洞的反思(如「再試一次」)alpha 趨近於零,價值主要從後續步驟繼承。這個設計讓記憶建構偏向全域成功且局部可解釋的步驟。

實驗結果:五領域全面碾壓,消融揭露階層架構是關鍵

EvoAgentBench 主結果:MSCE 在全部五個領域達到最佳或並列最佳。與各領域最強 baseline 相比:

LoCoMo 長期對話記憶:Overall 61.23(最佳)、F1 49.89(最佳),單跳/多跳/時間推理三項全部第一。三層記憶架構在需要跨越多輪對話追溯事實的場景優勢顯著。

跨域遷移:在一個領域進化出的記憶和技能遷移到另一領域仍有效——平均 +3.93pp,六對遷移路徑全部正向。這證明 MSCE 學習的是可轉移的問題解決結構,而非領域特定的模板。

終身進化(Lifelong Evolution):隨著累積經驗從 p0 增長到 p100,Math +17pp、SE +15.39pp、IR +13.84pp。成本在 p25 短暫上升後持續下降到低於 p0。典型的「愈用愈聰明」曲線。

消融實驗五大發現:

對 DKY / Hermes 的啟發

MSCE 跟 Hermes 現有架構有驚人的對應關係,三個直接啟發:

限制