8件の記事
モデルを再学習せず、実行ログだけからエージェントの制御プログラムを評価中に改善できるのか。
GPT-5.6とClaude Fable 5の公式プロンプトガイドを読み比べ、GPT-5.5からの変化も踏まえて、モデルごとに何を任せ、何を明示すべきかを整理する。
LLMエージェントのwikiは、全部読ませるより「必要なページだけ開ける構造」にした方が本当に安く、品質も落ちないのか。
AIエージェントの安全性を、1つの万能スキャナではなく層ごとに違う証拠で見るにはどう設計すればよいのか。
Claude Fable 5 / Mythos 5 向け公式プロンプトガイドを、長時間動くAIエージェントの設計メモとして読む。
Claude Fable 5 と Mythos 5 の公式 System Card を、性能表ではなく「強いモデルをどう公開するか」の設計図として読む。
個人向けAIエージェントは、静的なプロフィールではなく、確認と修正で更新されるメモリループとして育てるべきなのでは、という論文。
LLMエージェント同士が共有言語を作る時、信号の容量よりも履歴をどう記憶するかが効くという論文。