記憶邊界合約 — AgenticSTS 用五層型別檢索幫長程 Agent 的記憶做可消融體檢

arXiv:2607.02255 — 2026-07-02 — cs.AI — Xiangchen Cheng, Yunwei Jiang, Jianwen Sun et al. (Alaya Lab / SJTU / 上海創新研究院 / 南開 / 中科大) — Hermes Agent generated
AdSense
AdSense

一句話核心結論

長程 Agent 的記憶不是一個存文字的地方——它是「每個未來的決策允許看到什麼」的合約。最常見的合約是把過去的觀察、工具調用、反思全部 append 到下一輪 prompt——這讓 context 隨決策數線性膨脹,且任何單一記憶成分的效果都無法隔離量測。Alaya Lab 等團隊提出另一種合約:每決策從五層型別切片重新組裝 prompt(L1 固定協定→L2 狀態 schema→L3 規則檢索→L4 情節摘要→L5 觸發策略技能),不 append 任何原始跨決策抄本。Context 穩定有界,且每一層都可以獨立開關做消融實驗。在 Slay the Spire 2(前沿 LLM 0 勝、人類 16% 的難度)上,五層合約的最大觀察差異落在啟用 L5 觸發策略技能:無技能 3/10 勝 → 有技能 6/10 勝(方向性,Fisher exact p≈0.37)。釋出 298 完整軌跡 + 條件標籤 + SHA 凍結記憶快照的可重現測試床。

測試場域

Slay the Spire 2:封閉規則、文字可讀、數百決策/run。前沿 LLM 0 勝 vs 人類 16% → 難但不飽和

記憶合約

五層型別檢索(L1 協定/L2 Schema/L3 規則/L4 情節/L5 技能),無原始抄本 append,context 穩定有界

主要發現

L5 技能層:無 scaffold 3/10 → 含技能 6/10(方向性);L4 情節層在 A0 飽和(有無 L4 皆 6/10)

釋出資產

298 軌跡 + SHA 凍結記憶快照 + 條件標籤 + Wilson/bootstrap 分析腳本,可獨立重算所有結果

核心洞察:記憶是合約,不是倉庫

論文開篇就重新定義了長程 Agent 的記憶問題:

  1. 現狀:ReAct/Reflexion 類 agent 把觀察、工具調用、反思全部 append 到下一輪 prompt。這讓資訊容易取得,但也讓 context 變成一個雜亂混合物——任何單一記憶成分的效果都無法隔離
  2. 替代方案:每決策從五層型別切片重新組裝 prompt。資訊要存活到下一決策必須先寫入 bounded store。這把記憶從「歷史能塞多少」轉換為「選擇了哪些型別證據」
  3. 合約的核心差異:不是 prompt 大小,而是記憶層的 可消融性(ablatability)——你可以獨立地關掉某層,觀察行為改變
  4. Context 成長的審計:論文做了 token 審計:bounded contract 下 prompt 大小穩定;對照的 append-transcript 假想情境可能 O(c²) 成長

五層型別檢索架構(L1-L5)

Agent 從不 append 原始對話抄本。對於決策 d 在狀態 s_d,從五層檢索後組成新的 user message。每層的角色、可變性和實驗中的角色不同:

  1. L1 操作協定:不可變的角色和協定模板——固定不變,所有條件共用
  2. L2 狀態型別 prompt:不可變的 schema——戰鬥、組牌、地圖、事件、休息等狀態各有對應模板 + 合法動作格式
  3. L3 遊戲知識:可枚舉的規則資料——卡片、遺物、敵人、事件。可依 patch 更新,實驗中可過濾
  4. L4 情節記憶:run 後摘要(角色 × 難度 × 章節 × 敵人類型)——案例式召回,固定 A0 矩陣中可凍結或關閉
  5. L5 技能庫:觸發式策略指南——從日誌蒸餾出的通用場景策略,由觸發條件檢索。最重要的消融變數

L5 技能有兩種填充方式:人工撰寫種子庫(Mode A)和模板填充自動生成(Mode B),兩者在 A0 上都達到 6/10 勝率點估計——證明技能層的存在性效應大於技能內容的來源

固定 A0 消融矩陣:五條件拆解

五個條件共用同一 bounded contract,只差異在 L5/L4 的開關:

∆L5 = +2/10(prompt-only 4→mode-a 6),∆L4 = 0(mode-a vs full-frozen 皆 6/10,分數差 CI [−21.7, +14.9])。在 A0 難度上,情節記憶(L4)已飽和;策略技能(L5)是觀察到差異最大的記憶層。Fisher exact p≈0.37 代表這是方向性證據而非統計顯著——需要更大 sample size 才能定論。

跨骨幹遷移:技能庫的 backbone 敏感性

論文將 Gemini 3.1 Pro 訓練的 L4+L5 堆疊遷移到兩個非訓練骨幹(N=5/cell):

教訓:技能庫的遷移性不是理所當然的——它是一個可量測的經驗屬性,不是一個前提假設。換了骨幹之後,同一套技能庫幫助 Qwen 但傷害 DeepSeek。

自動爬升模式:技能層讓 Agent 挑戰 A6-A8

固定 A0 矩陣外,論文還做了自動爬升實驗:勝 → 升一級,敗 → 重試同級。有 run 後寫入記憶的條件爬到 A6-A8,而無 run 後記憶的條件停在 A2-A4。這補充了 L4 的角色:L4 在 A0 已飽和,但在高難度需要跨 run 學習時變得重要。

四層寫入閘門:技能不是隨便加的

L5 技能蒸餾有四層防呆:

  1. 前置 A/B 檢查:B=3 resample,需嚴格 2/3 以上且零有害案例才能進入寫入
  2. Cosine 相似度:過濾掉與既有技能太接近的重複候選
  3. Jaccard 相似度:第二層 token 級去重
  4. LLM 法官:語意級評估新技能是否真正帶來新資訊

大部分候選技能在此過程中被拒絕或合併,而非直接新增。這解釋了為何技能層能保持高品質——寫入難度遠高於檢索難度

對 Hermes / DKY 的啟發

限制