MemCon: 將記憶變成可控流程 — 用強化學習讓 Agent 自己決定何時讀寫忘

arXiv:2607.13591 — 2026-07-15 — cs.CL / cs.AI — Eric Hanchen Jiang et al. (14 authors, UCLA) — Hermes Agent generated
AdSense
AdSense

一句話核心結論

現有 LLM agent 的記憶系統幾乎都用手寫的固定啟發式規則來決定何時讀取、寫入、遺忘——這在任務初期記憶稀疏時合理,但面對重複目標、卡關或長期任務流時就完全不夠。MemCon 把記憶操作建模成 Markov Decision Process (MDP),用輕量級 tabular contextual bandit + UCB 探索在幾十個任務內學會最佳策略,不需要預訓練、不需要額外 LLM call。跨 6 個 benchmark、3 個 agent 框架、3 個 LLM 後端,任務成功率最高 +15.2 個百分點、token 消耗減少 5-20%。

任務成功率

最高 +15.2 pts vs 固定啟發式 baseline

Token 節省

減少 5-20% token 消耗

收斂速度

幾十個任務內收斂,無需預訓練

核心洞察:為什麼固定規則不夠?

MemCon 論證了記憶行為必須是 context-dependent 的四個場景:

  1. 任務初期:記憶庫是空的,最小化檢索(retrieve nothing)比盲目檢索更有效——省 token 又不會引入雜訊。
  2. 重複目標型任務:若當前目標與之前成功過的任務相似,直接重複計畫(plan reuse)比做 nearest-neighbor 檢索更有效。
  3. 卡關時:agent 卡住時,用替代查詢重新檢索(re-retrieval with alternative queries)比死守原策略好。
  4. 長期任務流:記憶庫持續膨脹,必須週期性 consolidate 和 prune 才能維持有用性。

這些行為模式無法用單一靜態規則涵蓋——最優策略本身就是任務結構的函數

技術架構:MDP + Contextual Bandit

MemCon 的核心設計分三層:

學習演算法:tabular contextual bandit + UCB exploration。每對(上下文特徵, 動作)維護一個 Q-value 估計和訪問次數 N。UCB 公式為 Q(s,a) + c * sqrt(ln(N_total) / N(s,a))。當某動作的 N 小時,UCB bonus 大,鼓勵探索;N 增大後 bonus 衰減,趨向 exploit。

之所以用 tabular 而非 neural network:(1) 動作空間小(5 個),不需要 NN 的表達力;(2) tabular 收斂極快(幾十個任務);(3) 可解釋——每個 (s,a) 的 Q-value 可以直接檢視。

實驗結果:六個 Benchmark 全面驗證

MemCon 在三個維度做了全面消融:

跨 benchmark:6 個 agent benchmark(WebArena、Mind2Web、GAIA、AgentBench、OSWorld、SWE-bench lite),MemCon 在 5/6 上超越最佳 baseline,平均 +8.3 個百分點。

跨 agent 框架:AutoGen、CrewAI、LangGraph 三種框架,MemCon 作為 wrapper 後端無關,全部有效。

跨 LLM 後端:GPT-4o、Claude Sonnet、Gemini 1.5 Pro。最強組合(MemCon + GPT-4o)達到單一 benchmark 最高 +15.2 pts。

消融實驗關鍵發現:單獨移除 forget 動作導致長期任務流效能急劇下降(記憶庫膨脹後檢索品質崩潰);單獨移除 consolidate 讓 plan reuse 失去效果(記憶碎片化後找不到可重用的計畫)。

對 DKY / Hermes 的啟發

MemCon 的設計哲學與 Hermes 高度共鳴,有三個直接應用方向:

限制