個人向けAIは、ユーザーについて覚えるほど理解を深めるのか。それとも、まだ知らないことを忘れて過信するのか。
現在の質問には役立たなく見える文書が、次の検索を導くことで探索全体には不可欠になる。その価値をどう測ればよいのか。
エージェントの変更依頼が語る「挙動」と、リポジトリ内に分散した実装をどう結びつければ、探索量を減らしながら変更漏れを防げるのか。
ハーネス進化の点数上昇は、本当に再利用できる設計改善なのか、それとも同じ課題で試行回数を増やした効果なのか。
長く動くAIエージェントの記憶を、便利な検索機能ではなく、権限・削除・監査・復旧まで含む永続状態としてどう管理するか。
長い作業を最後の合否だけで採点すると、エージェントがどこまで進み、どこで止まったかを見失わないか。
長い作業で忘れた情報を、ただ検索するのではなく「いま必要な瞬間」にだけ思い出させるには、記憶をどう設計すればよいのか。
モデルを再学習せず、実行ログだけからエージェントの制御プログラムを評価中に改善できるのか。
最終テストに通っただけの実行と、スキルを正しく選び、手順どおり使えた実行をどう見分けるのか。
人間にとって読みやすいバグ報告と、AI修正エージェントが正しく直せるバグ報告は同じなのか。