LLMOps

AI(企業向け)

【AgentOps・ツール運用編】”つないで終わり”にしない——エージェントが呼ぶツール(MCP/Function)という”能力資産”の運用規律|ツールカタログ・版管理・契約テスト・寄与度評価・廃止(deprecation)で”いつの間にか壊れた道具を叩き続ける”を防ぐ運用設計

PromptOps編("指示資産")、ナレッジ運用編("参照資産")と続けてきた、エージェントの可変資産を運用対象として扱うシリーズ。その3本目にして最終回である本稿のテーマは、エージェントが「何を使えるか」——すなわち能力資産としてのツ...
AI(企業向け)

【AgentOps・ナレッジ運用編】”覚えさせて終わり”にしない——エージェントが参照する知識ベース(RAGインデックス)の運用規律

AIエージェントの品質を語るとき、私たちはつい「どんなモデルを使うか」「どんなプロンプトを与えるか」に目を奪われる。だが実運用でエージェントの回答精度をじわじわと蝕むのは、多くの場合そのどちらでもない。エージェントが実行時に参照する外部知...
AI(企業向け)

【AgentOps・PromptOps編】”プロンプトは設定ではなくソースコード”——指示資産を版管理する運用規律

はじめに 連載⑦「デプロイ」で、私たちは「そもそも何がリリースなのか」を整理しました。AIエージェントの世界では、リリースされるのはモデルの重みだけではありません。プロンプト(システム指示)、ツールの説明文、メモリスキーマ——これら...
AI(企業向け)

【AgentOps⑦・デプロイ】”テストは緑、本番は別物”の落とし穴——エージェント・デプロイのライフサイクル運用規律|「何がリリースか」の再定義(プロンプト/モデル/ツール定義/メモリスキーマ)・カナリア/シャドー/段階的自律のプログレッシブデリバリー・オンライン評価ゲート(②評価と直結)・サイレントなモデル更新へのバージョンピン留め・状態を持つエージェントのロールバック設計で「リリースが事故になる」を防ぐ運用設計

この連載では、AIエージェントを「作って動かす」段階から、「運用として回し続ける」段階へと視点を移してきました。②評価で品質の測り方を、③観測でシステムの見える化を、④コストでユニットエコノミクスを、⑤メモリで長期記憶のライフサイクルを、...
AI(企業向け)

【AgentOps⑥・権限】“付けたら付けっぱなし”の落とし穴——エージェント権限のライフサイクル運用規律|Just-in-Timeアクセス・最小権限のドリフト監視・権限行使の可観測性(誰が・何を・なぜできたか)・過剰権限=ブラストラジウスのコスト・卒業/失効(deprovisioning)で「権限が事故になる」を防ぐ運用設計

AgentOps連載: ①入門/ ②評価/ ③観測/ ④コスト/ ⑤メモリ/ ⑥権限(本記事) エージェントに強い権限を渡すと、できることは一気に増えます。ファイルを読み、APIを叩き、他システムへ書き込み、決済にまで手が届く——最...
AI(企業向け)

【AgentOps⑤・メモリ】「覚えるほど賢くなる」の落とし穴——エージェント長期記憶のライフサイクル運用規律|保持/忘却ポリシー・記憶品質のドリフト監視・「その記憶は成功率に効くか」のメモリ評価・想起の可観測性(何をなぜ思い出したか)・メモリ肥大とコンテキストコストの制御で「記憶が事故になる」を防ぐ運用設計

はじめに——「覚えるほど賢くなる」という前提が、静かに裏返るとき エージェントに長期記憶(メモリ)を持たせると、ユーザーの好みや過去のやり取りを覚え、回答は目に見えて賢くなります。だからこそ多くのチームが「まず記憶を貯めよう」から着...
AI(企業向け)

【AgentOps①・入門】AgentOpsとは何か——「作れる」から「運用し続けられる」へ|MLOps/LLMOpsとの違いと、エージェント運用の全体像(評価・オブザーバビリティ・コスト・メモリ・権限・デプロイ・インシデント)を1枚のライフサイクルに束ねる連載スタート

はじめに——「作れる」時代は終わり、「運用し続けられる」が問われ始めた 2026年、AIエージェントを作ることのハードルは劇的に下がりました。フレームワークもテンプレートも揃い、PoC(実証実験)レベルなら数日で「それらしく動くもの...
AI(企業向け)

【2026年版】AIエージェントの「セマンティック・テレメトリ/意図トレース」設計ガイド——「何をしたか」のログでは足りない、「なぜそうしたか」を再現可能にするOpenTelemetry GenAI拡張・Decision Provenance・反実仮想ログの本番運用フレームワーク

はじめに——「何をしたか」のログでは、もう事故は防げない 本番稼働中のAIエージェントが、顧客の重要なファイルを誤って削除した。承認すべきでない取引を承認してしまった。サポートチケットに不適切な回答を返した——こうしたインシデントは...
AI(企業向け)

ローカルLLM×「本番運用Observability」設計ガイド【2026年版】——Ollama+OpenLLMetry・Langfuse・PrometheusでローカルLLMの応答品質ドリフト・推論レイテンシ・GPU利用率・幻覚率を可視化し、PoC卒業後の「壊れかけ」を検知する監視基盤

「PoCではちゃんと動いていたのに、本番運用に入って3か月、なんだか回答が変なときがある」——ローカルLLMを社内で運用し始めた企業から、こんな相談が増えています。 クラウドのChatGPTやClaudeなら「ベンダーが品質を保って...
AI(企業向け)

ローカルLLM×「本番運用Observability」設計ガイド【2026年版】——Ollama+OpenLLMetry・Langfuse・PrometheusでローカルLLMの応答品質ドリフト・推論レイテンシ・GPU利用率・幻覚率を可視化し、PoC卒業後の「壊れかけ」を検知する監視基盤

ローカルLLM(Ollama、LM Studio、vLLM等)を社内導入したものの、PoCで動作確認をした後は「とりあえず動いている」状態のまま放置されているケースが急増しています。実はここに大きな落とし穴があります。 クラウドAP...
タイトルとURLをコピーしました