メインコンテンツへスキップ
このガイドでは、Serverless Inference で W&B Weave を使う方法を紹介します。Serverless Inference を使うと、自前のインフラストラクチャーを用意したり、複数のプロバイダーの APIキー を管理したりすることなく、すぐに使えるオープンソースモデルで LLM アプリケーションを構築し、トレースできます。W&B APIキー があれば、Serverless Inference でホストされているすべてのモデル を利用できます。

このガイドで学べること

このガイドでは、次のことを学びます。
  • Weave と Serverless Inference を設定する
  • 自動トレースを備えた基本的な LLM アプリケーションを構築する
  • 複数のモデルを比較する
  • データセットに対するモデル性能を評価する
  • Weave UI で結果を確認する

前提条件

  • W&Bアカウント
  • Python 3.10+ または Node.js 18+
  • 必要なパッケージがインストールされていること:
    • Python: pip install weave openai
    • TypeScript: npm install weave openai
  • OpenAI APIキー が環境変数として設定されていること

最初の LLM 呼び出しをトレースする

まず、次のコード例をコピー&ペーストしてください。このコード例では、Serverless Inference の Llama 3.1-8B を使用します。 このコードを実行すると、Weave は次のことを行います。
  • LLM 呼び出しを自動的にトレースします
  • 入力、出力、レイテンシ、トークン使用量をログします
  • Weave UI でトレースを表示するためのリンクを提供します

テキスト要約アプリケーションを構築する

次に、このコードを実行してみてください。これは、Weave がネストした処理をどのようにトレースするかを示すシンプルな要約アプリです。

複数のモデルを比較する

Serverless Inference では、複数のモデルを利用できます。次のコードを使用して、Llama と DeepSeek の応答のパフォーマンスを比較します。

モデル性能を評価する

Weave に組み込まれている EvaluationLogger を使用して、Q&A タスクにおけるモデルの性能を評価します。これにより、自動集約、トークン使用量の取得、UI での高度な比較機能を備えた、構造化された評価のトラッキングが可能になります。 前のセクションで使用したスクリプトに、次のコードを追記します:
これらの例を実行すると、ターミナルにトレースへのリンクが表示されます。いずれかのリンクをクリックすると、Weave UIでトレースを確認できます。 Weave UIでは、次のことができます。
  • すべてのLLM Callのタイムラインを確認する
  • 各operationの入力と出力を調べる
  • トークン使用量と推定コストを表示する (EvaluationLoggerが自動的に取得)
  • レイテンシとパフォーマンスのメトリクスを分析する
  • Evals タブにアクセスして、集計された評価結果を確認する
  • Compare 機能を使用して、異なるモデル間のパフォーマンスを分析する
  • 個々の例を順に見ながら、同じ入力に対して異なるモデルがどのようなパフォーマンスを示したかを確認する

利用可能なモデル

利用可能なモデルの一覧については、Serverless Inference ドキュメントの利用可能なモデル セクションを参照してください。

次のステップ

トラブルシューティング