Blog
AI、開発メモ、論文まとめ、読書、日々の学びを同じ記事としてまとめています。
JSONで答えるよう指定するだけで、モデルが選ぶ答えまで無難な多数派へ寄ってしまうのか。
長い会話や操作履歴をそのまま検索せず、事実と手順へ変換すると、異なる仕事でも同じ記憶基盤を使えるのか。
文書が増えたとき、AIエージェントに直接探させるのと、先にBM25で候補を絞るのはどちらが強いのか。
過去の実行ログから失敗原因を学び、ケースごとにエージェントのハーネスを調整するMemoHarnessの仕組みと評価を整理する。
深い調査は、検索回数を増やすより「検証済みの進捗を残し、未解決の条件だけを調べ直す」方が強くなるのか。
長い履歴は要約して縮めるべきなのか、それとも完全に残して必要な時だけコードで読めばよいのか。
似たスキルが増えたとき、検索はなぜ定型文に引っ張られ、本当に必要な能力を見失うのか。
事実誤認の少ない長文回答でも、肝心な情報が抜ける。自由回答の「必要な内容が揃っているか」をどう評価するのか。
人間向けの動画やコードを、AIエージェントが実行できるスキルへ変えるには何が必要か。
文化について正しく答えられるLLMでも、曖昧な場面では一部の国だけを「標準的な文化」として持ち出していないか。