個人向けAIエージェントは、静的なプロフィールではなく、確認と修正で更新されるメモリループとして育てるべきなのでは、という論文。
長期AIエージェントの記憶を、全部の履歴ではなく意思決定ごとの型付き契約として見ると何が変わるのか。
LLMエージェント同士が共有言語を作る時、信号の容量よりも履歴をどう記憶するかが効くという論文。
AIエージェントの記憶を、固定の保存機構ではなく学習できる認知スキルとして見ると何が変わるのか。
コーディングエージェントを、一発でパッチを出せるかではなく、ユーザーと要件を発見しながら長い開発セッションを進められるかで評価する論文。
コーディングエージェントにテスト実行をいつ許すべきかを、成功率とコストの両面から考える論文。
コーディングエージェント時代に、ソフトウェアエンジニアへ求められる技能がどう変わるのかを考える論文。
MMLU、GPQA、SWE-bench、Terminal-Bench、LongMemEval、SkillEvolBenchなど、LLM・AIエージェント論文でよく見る評価ベンチマークを目的別に整理する。
AIエージェントの記憶を、RAG部品ではなく保存・抽出・検索・保守を持つデータ管理システムとしてどう評価するか。
長いAIエージェント作業の文脈圧縮を、固定の長さではなく、作業単位が閉じたかで判断する論文。