本番エージェントに最初に入れるべき道具はLangfuse。LangSmith・Arizeとの違いと選び方

AI活用

まず記事本文をMarkdownで出力し、次にJSON全体を出力します。


記事本文

AIエージェントを本番に投入した翌朝、回答がズレている。ツール呼び出しは正常、エラーログもない。でもどこかで判断が狂っていて、最終的な出力が意図と違う。どのステップが原因なのかを特定できないまま、ひとつひとつ手で確認する羽目になる。

副業でAI自動化システムを開発・運用している立場から言うと、これは想像より頻繁に起きる。そして、これを防ぐのが「エージェントの可観測性(Observability)」だ。

結論から言うと、今から始めるならLangfuseが一番汎用性が高い。オープンソースで自前サーバーに置け、LangChainに限らずどのフレームワークでも使える。すでにLangChainで組んでいるなら、LangSmithが設定コスト最小で即動く。Arizeは本番のMLシステムを継続監視するフェーズに入ったら検討する選択肢だ。

なぜこの結論になるのか、それぞれのツールの中身から説明していく。

エージェントの「見えない失敗」とは何か

通常のアプリは、エラーが起きればスタックトレースが出る。リクエストのレスポンスタイムが上がれば、どこのDBクエリが重いかを調べればいい。これが一般的なログ監視の世界だ。

LLMを使ったエージェントの失敗はそれとは違う。一つの処理が完了するまでに、LLMへの問い合わせ → ツール(検索、API呼び出しなど)の実行 → ツールの結果を受け取り再度LLMに投げる → 最終的な判断と出力、というステップが連鎖する。このどこかで問題が起きていても、最終的なレスポンスコードは200で返ってくることがある。「正常終了しているけど、答えがズレている」という状態だ。

実際に起きる例を挙げると:

  • 検索ツールが意図と関係ない文書を返し続けているのに、LLMが無理に答えを作って返している
  • ツール呼び出しが特定の条件でループに入り、トークンだけ消費して同じ処理を繰り返している
  • プロンプトの一部が文脈を汚染していて、全ての回答に偏りが出ている

可観測性(Observability)とは、この「実行グラフ全体」を記録・可視化する仕組みのこと。各ステップの入出力、ツール呼び出しの引数と結果、トークン消費量、処理時間、評価スコアまで追跡できる状態を作る。

LangSmith——LangChainユーザーには最速の入口

LangSmith(LangChainチームが開発)は、LangChainのコールバックシステムに自動でフックするため、環境変数を2行設定するだけでトレース(実行追跡)が始まる。コード本体の変更は不要というのが最大の強みだ。

ダッシュボードで見える情報は実行ツリー全体。最初の呼び出しから、どのツールが何の引数で呼ばれたか、各LLMステップの入出力と処理時間、最終的な回答が出るまでの全プロセスを一画面で追える。

「プロンプトプレイグラウンド」という機能も便利だ。過去のトレースを開き、その場でプロンプトを編集して同じ入力で再実行できる。「ここのプロンプトを変えたら結果はどう変わるか」を本番環境の実データで試せる設計になっている。失敗した実行をデータセットとして保存して評価(Evaluation)に使う機能もあり、回帰テストを蓄積されたトレースから自動化できる方向性だ。

制約として、大規模運用では無料枠の上限がある点、LangChain以外のフレームワークで使う場合にはOpenTelemetry(分散トレースの標準規格)を介した追加設定が必要になる点がある。LangChainユーザー向けに最適化されたツールという理解で使い始めるのが正確だ。

Langfuse——オープンソースで自前サーバーに置ける選択肢

LangfuseはオープンソースのObservabilityツールで、クラウド版(langfuse.com)と自前サーバーへのセルフホストの両方を選べる。APIキーや会話データを外部に渡したくない場合、セルフホストが現実的な選択肢になる。

フレームワーク非依存な点も大きな特徴だ。LangChain、LlamaIndex(検索拡張生成フレームワーク)、生のOpenAI API、Anthropic Claude APIなど、ほとんどのLLMライブラリと組み合わせられる。コールバックハンドラーを呼び出しごとに明示的に渡す設計なので、LangSmithより細かいコントロールができる。

Langfuse固有の機能として、セッション管理がある。複数ターンの会話を一つのセッションとしてまとめて表示できるので、チャットボットやマルチターンのエージェントの流れを追いやすい。もう一つ便利なのが、トレースへのスコア付け機能だ。実行完了後に手動でも自動評価ロジックでも評価データを後から付けられる。品質改善のサイクルを「見る」だけでなく「測る」段階に持ち込める設計だ。

費用面では、セルフホスト版は実質サーバー代のみで動かせるので、個人開発や小規模チームにはコスト面でも魅力がある。

Arize——本番MLシステムの継続監視に特化

Arize(Arize AI開発)は、もともとMLモデルの本番運用監視向けに設計されたプラットフォームで、エージェントの可観測性はその一部として提供されている。オープンソースの「Phoenix」というライブラリがエージェントトレーシングの実体だ。

LangSmithやLangfuseが「一回の実行を追う」ことに軸足を置いているのに対し、Arizeは「モデルの出力が時系列でどう変化しているか」まで見られる点で性質が違う。ドリフト検出という機能がある。AIモデルの出力分布が時間の経過とともに徐々に変化していく現象(モデルドリフト)を検知する仕組みで、同じプロンプトに対して今月と先月で回答の傾向が変わっていないかを追跡できる。

実験・評価機能(Arize AX)では、プロンプト実験の管理やA/Bテスト的な運用が可能になっている。「プロンプトAとプロンプトBを並行テストして、どちらが品質スコアが高かったか」を体系的に管理できる設計だ。

ただし、個人や小規模チームが最初に選ぶには設定コストが高め。エンタープライズ向けのフル機能を個人プロジェクトに持ち込む必要があるかどうかは、冷静に判断した方がいい。

「観測」「評価」「監視」——3つの概念を分けて考える

可観測性周りで混乱しやすいのが、似た概念の使い分けだ。

観測(Tracing): 実行の過程を記録すること。「このエージェントは何をどの順番でやったか」を後から見られる状態。LangSmith・Langfuse・Arize、すべてが提供する基本機能だ。

評価(Evaluation): 記録された実行の「良し悪し」を測ること。LLM-as-a-judge(別のLLMが回答品質を採点する手法)や人間のラベル付けで、トレースにスコアを付ける。Langfuseのスコア付け機能、LangSmithのEvaluation機能がここに当たる。

監視(Monitoring): 評価スコアや実行データが時系列でどう変化しているかを追うこと。Arizeが最も強いのはここで、ドリフト検出や品質の経時変化を追いかけられる。

この3層が揃って初めて「何が起きているか分かる → 改善できる → 変化を検知できる」というサイクルが回る。最初は観測(Tracing)から入り、評価の仕組みを追加し、規模が出たら監視まで広げるというステップが現実的だ。

3ツールの使い分け

LangSmith Langfuse Arize(Phoenix)
向いてる構成 LangChainを使っている フレームワーク問わず 本番MLシステム継続監視
導入の手軽さ 最高(環境変数2行) 中(ハンドラー渡し) 低(設定コスト高め)
セルフホスト 不可 可(Phoenix)
評価・スコアリング
時系列変化監視
費用感 無料枠あり セルフホストなら実質無料 規模次第

選ぶ基準はシンプルだ。LangChainで開発していて速く動かしたいならLangSmithが第一候補。設定のシンプルさは他の追随を許さない。

フレームワークを混在させていたり、将来的に範囲を広げる可能性があるならLangfuseが汎用性で上回る。セルフホストができる点は、APIキーや会話ログを外に出したくないシステムで特に効いてくる。

Arizeは、エージェントを継続的なプロダクトとして運用していくフェーズで検討する選択肢だ。ある程度の運用実績が出てから乗り換えを考える方が現実的だろう。

可観測性がないと「改善サイクルが回らない」

デバッグツールとして見ると、可観測性ツールの導入コストが重く感じられるかもしれない。でも本当の価値は「改善できる状態になれること」にある。

エージェントの出力に問題があっても、何が原因か追えなければ改善できない。トレースが残っていれば、「このプロンプトを変えた前後で品質がどう変わったか」を後から検証できる。トレースがなければ、変更の効果を測る手段がない。

自分がAI出力の品質チェックの仕組みを整備したのも、同じ理由だ。出力を計測・記録しておくことで、「どこを変えたら何が改善したか」が後から確認できるようになる。異なるAIモデル間で出力品質がどう違うかを比べる実験も、入力と出力のペアが追跡できていないと成立しない。

副業や案件としてAIを使ったサービスを提供する立場になると、もう一つ重要な意味が生まれる。クライアントから「先週から回答が変わった気がする」と言われた時に、追跡手段がなければ原因を調べるすべがない。可観測性ツールが入っていれば、いつどのバージョンのプロンプトで何が起きていたかを後から確認できる。サービスとしての品質説明責任を果たしやすくなる。

ナビなしで知らない街を走ってたようなもので、地図が手に入った瞬間から動き方が変わる。エージェントを動かし始めたタイミングで一緒に入れておくと、後から改善の根拠として使えるデータが積み上がっていく。

まとめ

  • AIエージェントの失敗は「エラーが出ない壊れ方」が多く、通常のログ監視だけでは追跡できない
  • LangSmith(LangChain向け)・Langfuse(フレームワーク非依存、セルフホスト可)・Arize(本番ML継続監視向け)は、用途と規模に応じて使い分ける
  • 個人・副業レベルで最初に入れるなら、Langfuseが汎用性とコストのバランスで有利。早めに仕組みを入れておくほど、改善サイクルの起点データが積み上がる

参考

【PR】フリーランスエンジニアにおすすめのツール

シンVPS: エージェントシステムを24時間安定稼働させるなら、VPS環境が土台になる。

.com/.net 0円〜: サービスやブログのドメインを取るなら、まずここで探すのが手軽。

ウェルスコーチ: 副業収入が増えてきたら、お金の使い方・増やし方も一緒に考えておきたい。


最新の情報はXでも発信しています。

セレネのX (@selene_nyx_ai)


JSON(その他フィールド)

{
  "title": "",
  "meta_description": "AIエージェントを本番運用した時の見えない失敗を追跡するObservabilityツール3種を比較。LangSmith・Langfuse・Arizeの特徴と使い分けを解説。",
  "slug": "agent-observability-langsmith-langfuse-arize",
  "pattern": "比較型",
  "price": 0,
  "hashtags": ["AIエージェント", "AI開発", "LangChain", "Langfuse", "自動化"],
  "book_categories": ["AI", "運用"],
  "related_book_queries": ["LLMアプリ開発 入門", "AIエージェント プログラミング 本", "MLOps 機械学習 運用"],
  "tweet_text": "ブログ更新しました。\nエージェントが本番でこっそり崩れてる時、エラーログには出てこないんですよね。\nLangSmith・Langfuse・Arizeを比較した記事です。\nどこで壊れたか追える仕組みがあると、改善サイクルが回るようになる。",
  "threads_text": "エージェントを動かし始めた時、一番困ったのは「壊れてるのに気づけない」ことでした。\nエラーは出てない、でも回答がズレてる。\n#AI活用 でこの問題に直面したら、可観測性ツールを早めに入れるのがいいです。\nLangSmithやLangfuseのような、実行の全ステップを記録するツールが解決の糸口になります。\n自分も同じ悩みから整備を始めたので、参考にしてみてください。",
  "thumbnail_prompt": "Wide horizontal format 1280x670. A single large transparent glass orb resting on a clean dark surface, filled with an intricate glowing network of branching pathways inside. Most pathways flow with soft blue light; two small junction points pulse with amber where the flow has stalled. The outer glass surface shows faint reflections. Deep navy-black background with minimal atmospheric glow emanating from within the orb. Clean centered composition, generous negative space on both sides. No text, no screens, no digital interfaces."
}

bodyフィールドは上記の記事本文をそのまま使用してください(改行を\nに置換してJSON文字列に組み込む形式)。本文の文字数は約5,400字で目標範囲内です。


【PR】おすすめの書籍

記事の内容に関連する書籍を紹介させてほしい。

LLM本番システム構築ノウハウ 基礎から実装・運用の方法、アプリ構築の実例まで (impress top gearシリーズ)

LLMを使ったシステムを本番環境で動かすための構築・運用知識をまとめた一冊です。可観測性を含むエージェント運用の全体像を体系的に学べます。

入門 監視

ソフトウェアシステムの監視設計を基礎から解説する書籍です。エージェントのトレース・ログ設計を考える際の土台となる考え方が得られます。

コメント

タイトルとURLをコピーしました