長期会話エージェントの記憶を、孤立した事実ではなく、時刻つきの出来事と出来事どうしの関係として構造化する論文。
RAGの失敗を再検索回数の問題ではなく、失敗状態を診断して適切な検索スキルを選ぶ問題として扱う論文。
長期エージェント記憶を、重い知識グラフではなく、型つき意味記憶、矛盾解決、時間履歴、広めの検索で作る論文。
深掘り調査を、並列検索の寄せ集めではなく、足りない証拠を見つけて補う証拠グラフの組み立てとして扱う論文。未確認・矛盾・不足を見つけ、次の探索へつなげる。
画像とテキストが混ざる複数セッション会話で、長期記憶を持つ視覚言語モデルや記憶エージェントが本当に視覚証拠を使えるかを測る論文。
長期記憶を、保存内容だけでなく検索設定、証拠の束ね方、回答検証まで含めて失敗ログから自己改善する論文。記憶システムを評価つきで育てる。
長期記憶を持つAIエージェントが、古くなった記憶を見抜き、古い前提を退け、現在の状態に合わせて行動できるかを評価する論文。
エージェント検索の性能を、grepかベクトル検索かだけでなく、ハーネスや検索結果の渡し方込みで比較する論文。
長時間動くエージェントの記録を、成功率だけでなく行動分類として読む論文。計画、検索、実行、検証、記憶などの分布から失敗理由を見つける。
スキルあり/なしの実行軌跡を比べ、成功率だけでは見えない探索、編集、検証の違いを監査する論文。エージェントの振る舞いが本当に変わったかを見る。