公開している論文解説記事をまとめて読む入口です。
80件の記事
JSONで答えるよう指定するだけで、モデルが選ぶ答えまで無難な多数派へ寄ってしまうのか。
長い会話や操作履歴をそのまま検索せず、事実と手順へ変換すると、異なる仕事でも同じ記憶基盤を使えるのか。
文書が増えたとき、AIエージェントに直接探させるのと、先にBM25で候補を絞るのはどちらが強いのか。
過去の実行ログから失敗原因を学び、ケースごとにエージェントのハーネスを調整するMemoHarnessの仕組みと評価を整理する。
深い調査は、検索回数を増やすより「検証済みの進捗を残し、未解決の条件だけを調べ直す」方が強くなるのか。
長い履歴は要約して縮めるべきなのか、それとも完全に残して必要な時だけコードで読めばよいのか。
似たスキルが増えたとき、検索はなぜ定型文に引っ張られ、本当に必要な能力を見失うのか。
事実誤認の少ない長文回答でも、肝心な情報が抜ける。自由回答の「必要な内容が揃っているか」をどう評価するのか。
人間向けの動画やコードを、AIエージェントが実行できるスキルへ変えるには何が必要か。
文化について正しく答えられるLLMでも、曖昧な場面では一部の国だけを「標準的な文化」として持ち出していないか。
個人向けAIは、ユーザーについて覚えるほど理解を深めるのか。それとも、まだ知らないことを忘れて過信するのか。
現在の質問には役立たなく見える文書が、次の検索を導くことで探索全体には不可欠になる。その価値をどう測ればよいのか。
エージェントの変更依頼が語る「挙動」と、リポジトリ内に分散した実装をどう結びつければ、探索量を減らしながら変更漏れを防げるのか。
ハーネス進化の点数上昇は、本当に再利用できる設計改善なのか、それとも同じ課題で試行回数を増やした効果なのか。
長く動くAIエージェントの記憶を、便利な検索機能ではなく、権限・削除・監査・復旧まで含む永続状態としてどう管理するか。
長い作業を最後の合否だけで採点すると、エージェントがどこまで進み、どこで止まったかを見失わないか。
長い作業で忘れた情報を、ただ検索するのではなく「いま必要な瞬間」にだけ思い出させるには、記憶をどう設計すればよいのか。
モデルを再学習せず、実行ログだけからエージェントの制御プログラムを評価中に改善できるのか。
最終テストに通っただけの実行と、スキルを正しく選び、手順どおり使えた実行をどう見分けるのか。
人間にとって読みやすいバグ報告と、AI修正エージェントが正しく直せるバグ報告は同じなのか。
デプロイ後のエージェントが経験ログをどう能力へ変えるのかを、ハーネス、スキル、記憶、評価、安全性の地図として整理するサーベイ。
LLMは訓練データをどれくらい覚えられるのかを、抽出できるかではなく「何ビット短く圧縮できるか」で測る論文を読む。
エージェント用スキルは人間が書く説明書なのか、それともエージェント自身が検証しながら育てる操作知なのかを読む。
LLMエージェントの違法行動を、モデル自身が合成したコードハーネスで抑える研究を読む。
LLMエージェントのwikiは、全部読ませるより「必要なページだけ開ける構造」にした方が本当に安く、品質も落ちないのか。
エージェントのスキル更新を、最終版だけでなく採用・却下・評価証拠の履歴として残すと何が変わるのか。
個人向けAIエージェントは、静的なプロフィールではなく、確認と修正で更新されるメモリループとして育てるべきなのでは、という論文。
長期AIエージェントの記憶を、全部の履歴ではなく意思決定ごとの型付き契約として見ると何が変わるのか。
LLMエージェント同士が共有言語を作る時、信号の容量よりも履歴をどう記憶するかが効くという論文。
AIエージェントの記憶を、固定の保存機構ではなく学習できる認知スキルとして見ると何が変わるのか。
コーディングエージェントを、一発でパッチを出せるかではなく、ユーザーと要件を発見しながら長い開発セッションを進められるかで評価する論文。
コーディングエージェントにテスト実行をいつ許すべきかを、成功率とコストの両面から考える論文。
コーディングエージェント時代に、ソフトウェアエンジニアへ求められる技能がどう変わるのかを考える論文。
AIエージェントの記憶を、RAG部品ではなく保存・抽出・検索・保守を持つデータ管理システムとしてどう評価するか。
長いAIエージェント作業の文脈圧縮を、固定の長さではなく、作業単位が閉じたかで判断する論文。
AIエージェントの経験を、同じ場面だけでなく別タスクや別モデルにも移せる手続き記憶として測る論文。
AGENTS.mdのようなリポジトリガイダンスを、書いて終わりではなく、失敗プローブで穴を見つけて改善する運用資産として扱う論文。
LLMエージェントが実行中に生んだ行動軌跡を、別のエージェントが検索して再利用できる共有記憶として扱う論文。
長い文脈や複雑なルールから、あとで再利用できる自然言語スキルを作れるかを扱う論文。課題生成、回答、採点、更新を回してスキル化を試す。
AI科学者の研究過程をモデル内部に閉じず、証拠、アイデア、実験、修復、主張監査を外部成果物として残す論文。
企業ナレッジベースの上で、LLMが検索、閲覧、要約を使い分けるエージェント型RAGの論文。固定検索だけでは届かない質問に、どこまで自律探索を足すべきかを見る。
エージェントスキルやSKILL.mdのような手順書が、本当に行動と成果を変えているかを測る評価フレームワーク。代表タスク、隠し評価基準、スキルあり/なし比較で効き方を見る。
長期LLMエージェントの文脈管理を、削るだけでなく、プロンプトキャッシュが効く入力配置として安定させる論文。
エージェントの性能をモデル単体ではなく、プロンプト、ツール、記憶、制御からなるハーネスの設計・適応・進化問題として扱う論文。
研究エージェントに渡す知識を、論文リストや要約ではなく、主張・証拠・手法のつながりとして構築する論文。調査の出典、系譜、根拠をエージェントが辿れる形にする。
長大なコーパスを扱う時に、サブエージェントを再帰的に呼び出すハーネス設計を扱う論文。裸のモデル呼び出しではなく、実行基盤ごと分割する。
変化し続ける端末、ソフトウェア、好みに対して、LLMエージェントの記憶が現在状態へ追従できるかを測る論文。静的ベンチマークでは見えない記憶の劣化を見る。
Text-to-SQLの失敗経験を構造化されたヒント集に変換し、実行時に関連ヒントを検索してSQL生成を改善するシステム。
エージェントハーネスという曖昧な言葉を、モデルを実行可能なエージェントにする境界層として定義する概念分析の論文。
LLMエージェントのスキル更新を、成功ログの足し算ではなく、検証済み軌跡に基づく事後分布の更新として扱う論文。追記、分割、圧縮、退役を更新候補として見る。
コーディングエージェントの過去トレースから、次のスキルと検証タスクを作る論文。ログを読むだけで終えず、実行検証へ戻す。
個人AIエージェントの長期記憶検索を、単なる類似度検索ではなく信頼境界として扱う論文。危ない記憶を文脈に入る前に止める。
長期タスクのLLMエージェントで使われる記憶システムを、精度だけでなく構築コスト、検索遅延、鮮度、保存量の負荷として測る論文。記憶を入れれば賢くなる、で止めないための整理。
一回のタスク経験が、未来のエージェントで使える手続き的スキルへ育つかを測るベンチマーク。経験の再利用とスキル形成を分けて見る。
エージェントのスキル集合を、平らな保存庫ではなく、原子的スキルと抽象スキルの階層として整理する論文。
長時間動くLLMエージェントを、状態・権限・再開・監査を持つ実行主体として扱う実行環境の論文。道具を渡すだけでなく、権限境界と永続状態をどう設計するかが焦点になる。
検索エージェントの状態をモデル内に抱え込ませず、ハーネス側の作業記憶へ外出しする論文。方策を検索判断に集中させる設計を扱う。
長期エージェント記憶を、保存箱や検索システムではなく、時間とともに更新される状態管理として捉え直す論文。忘却、改訂、整合性を扱う。
長期対話やエージェントアプリの記憶を、過去メモではなく永続状態を管理する記憶基盤として設計する論文。
多段の試行錯誤検索を、語彙補強とコーパス統計にもとづく1回の強い検索へ圧縮する検索エージェントの論文。
エージェントのスキルを、一度きりの生成物ではなく、作成、記憶、管理、評価、改善のライフサイクルで育てる論文。
自然言語のエージェントスキルを、凍結モデルの外側にある改善可能な状態として扱い、実行、反省、編集、検証ゲートで育てる手法。
エージェント型RAGが、従来の強化されたRAGより常に優れているわけではないことを実験で示す論文。効果、コスト、時間の釣り合いを見る。
コードをLLMの最終成果物ではなく、エージェントが推論、行動、状態保持、検証、協調を行うための実行基盤として捉え直すサーベイ。
エージェントスキルを自然言語の塊ではなく、呼び出し条件、実行手順、副作用、再利用リスクを分けた構造として扱う論文。
長期会話エージェントの記憶を、孤立した事実ではなく、時刻つきの出来事と出来事どうしの関係として構造化する論文。
RAGの失敗を再検索回数の問題ではなく、失敗状態を診断して適切な検索スキルを選ぶ問題として扱う論文。
長期エージェント記憶を、重い知識グラフではなく、型つき意味記憶、矛盾解決、時間履歴、広めの検索で作る論文。
深掘り調査を、並列検索の寄せ集めではなく、足りない証拠を見つけて補う証拠グラフの組み立てとして扱う論文。未確認・矛盾・不足を見つけ、次の探索へつなげる。
画像とテキストが混ざる複数セッション会話で、長期記憶を持つ視覚言語モデルや記憶エージェントが本当に視覚証拠を使えるかを測る論文。
長期記憶を、保存内容だけでなく検索設定、証拠の束ね方、回答検証まで含めて失敗ログから自己改善する論文。記憶システムを評価つきで育てる。
長期記憶を持つAIエージェントが、古くなった記憶を見抜き、古い前提を退け、現在の状態に合わせて行動できるかを評価する論文。
エージェント検索の性能を、grepかベクトル検索かだけでなく、ハーネスや検索結果の渡し方込みで比較する論文。
長時間動くエージェントの記録を、成功率だけでなく行動分類として読む論文。計画、検索、実行、検証、記憶などの分布から失敗理由を見つける。
スキルあり/なしの実行軌跡を比べ、成功率だけでは見えない探索、編集、検証の違いを監査する論文。エージェントの振る舞いが本当に変わったかを見る。
外部スキルを増やし続けるのではなく、維持、退役、拡張を選びながら管理する論文。どのスキルが今のタスクに貢献しているかを評価する。
調査エージェントが過去の探索結果や証拠を記憶バンクとして再利用する論文。深掘り調査で何を残し、どう取り出すかを見る。
Shepherdは、エージェントの作業を別の監督役が観察し、危ない分岐や失敗の兆候を見つけて介入する仕組み。長い自律作業を任せる時に、いつ止め、いつ戻し、いつ人へ確認するかを考える入口になる。
検索結果の要約を読むだけでなく、エージェントがコーパスを直接歩き、必要な箇所を探し直す方法を扱う論文。RAGを検索器単体ではなく探索行動として見る。
外部記憶だけに頼るエージェントの限界を整理し、良い経験をモデル重みやスキルへ戻す必要を論じる記事。文脈、記憶、学習の役割分担を考える。