| 來源 | 日期 | 核心貢獻 |
|---|---|---|
| Mem0: State of AI Agent Memory 2026 | 2026-05 | 唯一跨框架 benchmark 數據的生產級方案。LoCoMo 91.6%、LongMemEval 93.4%,平均 retrieval 低於 7,000 tokens |
| Steve Kinney: Memory Systems for AI Agents | 2026-03 | 三軸框架(Forms / Functions / Dynamics)+ 設計決策樹,最佳研究到實務的橋樑 |
| arXiv:2603.07670 — Memory for Autonomous LLM Agents | 2026-03 | 由 Pengfei Du 撰寫的完整綜述:write-manage-read 循環、五種機制家族、四項新 benchmark |
一個長上下文 benchmark 測試的是:「模型能否在 100K、1M 或 10M token 的單一輸入中找到目標資訊?」一個記憶 benchmark 測試的是:「系統在第 50 回合的表現,取決於它在第 1 到第 49 回合做了什麼——寫了什麼、存了什麼、能否正確取回。」
這兩種能力是不同維度的問題。長上下文失敗時,模型忽略了正確的資訊區段。記憶失敗時,可能有三種原因:存了錯的東西、存對了但取錯了、或存對取對但排序爛掉。
Mem0 的 2026 年報告定義了一個完整的記憶 benchmark 必須測試五件事:
| Benchmark | Mem0 分數 | 測試維度 |
|---|---|---|
| LoCoMo | 91.6% | 長期對話記憶、多會話連續性 |
| LongMemEval | 93.4% | 跨 session 事實檢索 |
| BEAM (1M) | 62% | 超大規模記憶檢索 |
關鍵指標:Mem0 的最新 token 效率演算法平均每次 retrieval 不到 7,000 tokens,而全上下文方案要 25,000+ tokens——差距近 4 倍。
Steve Kinney 綜合了數十篇論文後提出:傳統的「短期 vs 長期記憶」二分法已經過時。現代 agent 記憶系統應該用三個軸來理解:
| 形式 | 機制 | 實用度 |
|---|---|---|
| Token-level | 在 context window 中壓縮歷史 | 最簡單但最貴 |
| Latent(外部儲存) | 向量 DB、知識圖譜、語義三元組 | 目前主流,Mem0 這類方案 |
| Parametric | 微調 / fine-tune 嵌入記憶 | 研究前沿,成本高 |
arXiv:2603.07670 由 Pengfei Du 撰寫,覆蓋 2022 到 2026 年初的所有重要工作。該綜述將 agent 記憶形式化為一個與感知和行動緊密耦合的 write–manage–read 循環,並提出五種機制家族:
| 家族 | 做法 | 代表工作 |
|---|---|---|
| Context-resident compression | 在 context window 內壓縮歷史對話 | LLMLingua、Selective Context |
| Retrieval-augmented stores | 外部向量 DB / 知識庫 + 動態檢索 | Mem0、MemGPT、Letta |
| Reflective self-improvement | Agent 自我反思,從過去互動中學習 | Reflexion、Generative Agents |
| Hierarchical virtual context | 多層次記憶架構(工作 / 短期 / 長期) | MemGPT OS、A-Mem |
| Policy-learned management | RL 訓練記憶管理策略 | H-MEM、Agentic Memory |
Mem0 明確指出:記憶至少包含提取(extract)、寫入(write)、檢索(retrieve)、修剪(prune)四個子功能。只測試檢索的 benchmark 只測了四分之一。
StructMemEval(arXiv:2502.13649)的實驗結果顯示:在很多場景下,簡單的檢索方案表現優於多層次記憶架構。與其設計複雜的記憶階層,不如先把寫入過濾和檢索排序做好。
Mem0 的 7,000 tokens/retrieval vs 25,000+ tokens 的差距說明了:不是能不能記住的問題,是每記一件事要花多少錢。在生產環境中,記憶系統的 token 效率比 recall 分數更重要。
我們目前的記憶架構(MEMORY + fact_store + session_search + agent_memory.db)其實已經在實踐這些研究建議:
下一步可以考慮的方向:寫入過濾(不把所有用戶輸入都寫進 memory)和矛盾檢測(fact_store 已有 contradict,可強化為自動觸發)。