オンライン評価

AI(企業向け)

【AgentOps⑦・デプロイ】”テストは緑、本番は別物”の落とし穴——エージェント・デプロイのライフサイクル運用規律|「何がリリースか」の再定義(プロンプト/モデル/ツール定義/メモリスキーマ)・カナリア/シャドー/段階的自律のプログレッシブデリバリー・オンライン評価ゲート(②評価と直結)・サイレントなモデル更新へのバージョンピン留め・状態を持つエージェントのロールバック設計で「リリースが事故になる」を防ぐ運用設計

この連載では、AIエージェントを「作って動かす」段階から、「運用として回し続ける」段階へと視点を移してきました。②評価で品質の測り方を、③観測でシステムの見える化を、④コストでユニットエコノミクスを、⑤メモリで長期記憶のライフサイクルを、...
AI(企業向け)

【2026年版】AIエージェントの「評価・トラジェクトリ採点」設計ガイド——「動いた」と「正しく仕事をした」は別物|タスク成功率・ツール呼び出し精度・軌跡効率をτ-bench/LLM-as-Judgeで継続採点し、CIで回帰を止める

「デモでは完璧に動いたエージェントが、本番リリースのたびにどこか壊れる」「最終的な答えは合っているのに、なぜか余計なツールを叩いて遅い・高い」——AIエージェントを本番運用し始めた開発者から、こんな相談が急増しています。 従来のソフ...
タイトルとURLをコピーしました