エージェント評価

AI(企業向け)

【AgentOps②・評価】”測れる”の前に”何で測るか”——エージェント評価データセット(ゴールデンセット)の作り方・本番トラジェクトリからの評価ケース自動収集・リークと陳腐化を防ぐ「評価データ・フライホイール」設計

1. なぜ今「評価データそのもの」なのか——枠組みではなく燃料の話 評価の議論は「どう測るか(How to measure)」に偏りがちだ。だが実運用でボトルネックになるのは、ほぼ例外なく「何を測るか(What to measure...
AI(企業向け)

【AgentOps①・入門】AgentOpsとは何か——「作れる」から「運用し続けられる」へ|MLOps/LLMOpsとの違いと、エージェント運用の全体像(評価・オブザーバビリティ・コスト・メモリ・権限・デプロイ・インシデント)を1枚のライフサイクルに束ねる連載スタート

はじめに——「作れる」時代は終わり、「運用し続けられる」が問われ始めた 2026年、AIエージェントを作ることのハードルは劇的に下がりました。フレームワークもテンプレートも揃い、PoC(実証実験)レベルなら数日で「それらしく動くもの...
AI(企業向け)

【2026年版】AIエージェントの「評価・トラジェクトリ採点」設計ガイド——「動いた」と「正しく仕事をした」は別物|タスク成功率・ツール呼び出し精度・軌跡効率をτ-bench/LLM-as-Judgeで継続採点し、CIで回帰を止める

「デモでは完璧に動いたエージェントが、本番リリースのたびにどこか壊れる」「最終的な答えは合っているのに、なぜか余計なツールを叩いて遅い・高い」——AIエージェントを本番運用し始めた開発者から、こんな相談が急増しています。 従来のソフ...
タイトルとURLをコピーしました