AI Agent 記憶系統:從長上下文到跨會話持久記憶 —— 2026 技術全景

2026-07-13 · AI Agent 記憶系統研究報告 · 來源:Mem0 Research、Steve Kinney、arXiv:2603.07670

AI Agent Memory RAG Benchmark LLM Architecture

一句話摘要

把你的 context window 加大到 1M tokens 不等於你的 agent 有記憶。2026 年的 AI agent 記憶系統已經從「塞更多 token」轉向「寫入、管理、讀取」的完整循環——三個頂尖來源共同指向同一件事:真正的記憶需要獨立的儲存、檢索、更新和遺忘機制。

三份關鍵來源

來源日期核心貢獻
Mem0: State of AI Agent Memory 20262026-05唯一跨框架 benchmark 數據的生產級方案。LoCoMo 91.6%、LongMemEval 93.4%,平均 retrieval 低於 7,000 tokens
Steve Kinney: Memory Systems for AI Agents2026-03三軸框架(Forms / Functions / Dynamics)+ 設計決策樹,最佳研究到實務的橋樑
arXiv:2603.07670 — Memory for Autonomous LLM Agents2026-03由 Pengfei Du 撰寫的完整綜述:write-manage-read 循環、五種機制家族、四項新 benchmark

Context Window vs 記憶:不是同一個問題

一個長上下文 benchmark 測試的是:「模型能否在 100K、1M 或 10M token 的單一輸入中找到目標資訊?」一個記憶 benchmark 測試的是:「系統在第 50 回合的表現,取決於它在第 1 到第 49 回合做了什麼——寫了什麼、存了什麼、能否正確取回。」

這兩種能力是不同維度的問題。長上下文失敗時,模型忽略了正確的資訊區段。記憶失敗時,可能有三種原因:存了錯的東西、存對了但取錯了、或存對取對但排序爛掉。

關鍵區分:把一個在 1M token needle-in-a-haystack 測試拿高分的模型直接當作「有記憶」使用,就像用一個過目不忘但從不做筆記的人來管理你的 CRM——能力是真的,但用的方式根本錯了。

2026 記憶 Benchmark 全景

Mem0 的 2026 年報告定義了一個完整的記憶 benchmark 必須測試五件事:

  1. 跨會話連續性——不同 session 之間能取回相關事實
  2. 選擇性寫入——判斷該記什麼、不該記什麼
  3. 真實 token 預算下的檢索——不能每次 prompt 都灌 50K token 的記憶
  4. 遺忘與更新——覆蓋過時記憶,而非疊加
  5. 使用者隔離——A 的記憶不能跑進 B 的回應

三大記憶 Benchmark

BenchmarkMem0 分數測試維度
LoCoMo91.6%長期對話記憶、多會話連續性
LongMemEval93.4%跨 session 事實檢索
BEAM (1M)62%超大規模記憶檢索

關鍵指標:Mem0 的最新 token 效率演算法平均每次 retrieval 不到 7,000 tokens,而全上下文方案要 25,000+ tokens——差距近 4 倍。

三軸框架:Forms / Functions / Dynamics

Steve Kinney 綜合了數十篇論文後提出:傳統的「短期 vs 長期記憶」二分法已經過時。現代 agent 記憶系統應該用三個軸來理解:

軸一:Forms(記憶存在哪裡)

形式機制實用度
Token-level在 context window 中壓縮歷史最簡單但最貴
Latent(外部儲存)向量 DB、知識圖譜、語義三元組目前主流,Mem0 這類方案
Parametric微調 / fine-tune 嵌入記憶研究前沿,成本高

軸二:Functions(記憶做什麼)

軸三:Dynamics(記憶如何運作)

Write–Manage–Read 循環:五大機制家族

arXiv:2603.07670 由 Pengfei Du 撰寫,覆蓋 2022 到 2026 年初的所有重要工作。該綜述將 agent 記憶形式化為一個與感知和行動緊密耦合的 write–manage–read 循環,並提出五種機制家族:

家族做法代表工作
Context-resident compression在 context window 內壓縮歷史對話LLMLingua、Selective Context
Retrieval-augmented stores外部向量 DB / 知識庫 + 動態檢索Mem0、MemGPT、Letta
Reflective self-improvementAgent 自我反思,從過去互動中學習Reflexion、Generative Agents
Hierarchical virtual context多層次記憶架構(工作 / 短期 / 長期)MemGPT OS、A-Mem
Policy-learned managementRL 訓練記憶管理策略H-MEM、Agentic Memory

三個最重要的洞察

1. 記憶不是一個功能,是四個

Mem0 明確指出:記憶至少包含提取(extract)、寫入(write)、檢索(retrieve)、修剪(prune)四個子功能。只測試檢索的 benchmark 只測了四分之一。

2. 簡單檢索經常贏過複雜架構

StructMemEval(arXiv:2502.13649)的實驗結果顯示:在很多場景下,簡單的檢索方案表現優於多層次記憶架構。與其設計複雜的記憶階層,不如先把寫入過濾和檢索排序做好。

3. Token 預算是記憶系統的真正瓶頸

Mem0 的 7,000 tokens/retrieval vs 25,000+ tokens 的差距說明了:不是能不能記住的問題,是每記一件事要花多少錢。在生產環境中,記憶系統的 token 效率比 recall 分數更重要。

對 Hermes 記憶系統的啟示

我們目前的記憶架構(MEMORY + fact_store + session_search + agent_memory.db)其實已經在實踐這些研究建議:

下一步可以考慮的方向:寫入過濾(不把所有用戶輸入都寫進 memory)和矛盾檢測(fact_store 已有 contradict,可強化為自動觸發)。

來源

Hermes Lab 研究報告 · 自動發布 · © 2026 DKY