ログインお問い合わせ無料で開始
Model and Modality Playbooks2026年7月29日Flatkey Team

Text-to-Video製品チームのためのSeedance API評価フレームワーク

Text-to-video製品の本格展開前に、Seedance APIの品質、信頼性、ユーザー体験、安全性、コストを評価するための再現性のあるフレームワーク。

Text-to-Video製品チームのためのSeedance API評価フレームワーク

Seedance APIの評価は、ただ印象的なデモクリップを作るだけではなく、製品上の問いに答えるものであるべきです。本当の判断基準は、チームがプロンプトと参照メディアを、予測可能な品質、レイテンシ、安全性、コストで受け入れ可能な動画アセットに変換できるかどうかです。

2026年7月29日時点で、Flatkeyはseedance-2.5を、1080p出力対応のテキストから動画、および画像から動画生成向けのByteDanceの早期アクセス経路として掲載しています。現在のリクエストパターンは非同期です。POST /v1/video/generationsで動画タスクを作成し、返されたタスクIDを保持して、ジョブが終端状態に達するまでGET /v1/videos/{task_id}をポーリングします。

このAPI契約は単純です。しかし、有用なSeedance APIの評価を設計するのはもっと難しい作業です。このガイドでは、プロダクトマネージャーとエンジニアリングリード向けに、再現可能なテストセット、重み付きスコアカード、承認クリップあたりのコスト指標、そして5日間の展開計画を提供します。

簡単な答え: Seedance APIの評価では何を測るべきか?

APIを6つのゲートで評価します:

  1. 機能適合性: 製品が必要とするシーン、動き、フレーミング、参照の一貫性を生成できるか?
  2. 再現性: 同じプロンプト群で、複数回の実行にわたって使える結果が出るか?
  3. ワークフロー適合性: アプリケーションは非同期タスク、ポーリング、タイムアウト、ストレージ、リトライを適切に処理できるか?
  4. ユーザー体験の適合性: 待機、進捗、再生成、失敗について、正直な期待値を設定できるか?
  5. 安全性の適合性: 禁止入力を防ぎ、配信前に出力をレビューできるか?
  6. 単位経済性の適合性: 失敗ジョブと却下された出力を含めたとき、承認されたクリップ1本のコストはいくらか?

1回だけ選び抜いた生成結果を根拠に、プロバイダーを承認してはいけません。有用なSeedance APIの評価では、固定されたプロンプトセット、反復実行、ブラインドスコアリング、そして候補モデルごとに同じ承認基準を使用します。

まず現在のSeedance API契約を確認する

Flatkeyの現在のseedance-2.5モデルページには、プロンプト入力、オプションの画像、完了時の出力としてのMP4 URLを備えた早期アクセス経路が記載されています。ページの例では、5秒、1080pのタスクを作成します:

curl -X POST https://router.flatkey.ai/v1/video/generations \
  -H "Authorization: Bearer $FLATKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "seedance-2.5",
    "content": [
      {
        "type": "text",
        "text": "夕暮れのネオン都市の上を飛ぶ紙飛行機"
      }
    ],
    "resolution": "1080p",
    "duration": 5
  }'

次に、返されたIDを使ってタスクをポーリングします:

curl https://router.flatkey.ai/v1/videos/TASK_ID \
  -H "Authorization: Bearer $FLATKEY_API_KEY"

実装前に、公開中のSeedance 2.5 model pageを確認してください。早期アクセス期間中は、提供状況、リクエストフィールド、商用条件が変更される可能性があります。

チームがまだキーとベースURLを確認していない場合は、まず既存のSeedance APIクイックスタートを完了してください。接続が機能し、製品チームがこのルートが実際のユースケースに適しているかどうかを判断できる状態になってから、この記事を使用してください。

クリップを生成する前に評価契約を定義する

Seedance APIの評価において最も効果の大きいステップは、誰も結果を見る前に受け入れ基準について合意することです。さもないと、関係者は最も映画的に見えるクリップを高く評価し、実行ごとに基準を密かに変えてしまいがちです。

次の項目を書き出してください:

項目 製品チームの判断
対象ワークフロー ソーシャル向けクリエイティブ、製品モーション、ストーリーボード作成、ゲームコンセプト、広告バリエーション、またはその他の定義された業務
入力モード テキストから動画、画像から動画、またはその両方
出力要件 長さ、解像度、アスペクト比、フレーミング、および納品形式
必要なモーション カメラ移動、オブジェクトの動き、キャラクターの動き、またはほぼ静的な構図
参照要件 なし、緩いスタイル参照、または厳密な被写体/製品の一貫性
許容待ち時間 ユーザーが結果、または明確な失敗状態を見るべき最大時間
安全境界 禁止プロンプト、制限対象、レビュー手順、公開ルール
受け入れ責任者 最終的な利用可/不可の判断を行う役割
コスト単位 生成秒数あたり、完了タスクあたり、承認クリップあたり、または公開アセットあたりのコスト

受け入れ責任者は最終ワークフローに近い立場であるべきです。成長施策のクリエイティブ責任者は、製品形状が変わったために製品レンダリングチームが却下するクリップを承認するかもしれません。単一の品質スコアでは、すべてのユースケースを表すことはできません。

24プロンプトのSeedance APIテストセットを作成する

実用的なテストセットは、失敗パターンを明らかにできるほど十分に大きく、ルート、プロンプトテンプレート、またはモデルが変わったときに繰り返し実行できるほど十分に小さい必要があります。6つのグループにまたがる24個のプロンプトから始めてください。

プロンプトグループ プロンプト数 テスト内容
単純な被写体の動き 4 基本的な動き、オブジェクトの完全性、クリーンな背景
カメラと構図 4 パン、追従、クローズアップ、ワイドショット、およびフレーミング順守
複数要素の相互作用 4 空間的関係、衝突、遮蔽、時間的一貫性
製品またはブランド風オブジェクト 4 形状の安定性、素材の見え方、参照への感度
様式化されたクリエイティブシーン 4 アートディレクション、ライティング、雰囲気、プロンプト解釈
意図的なエッジケース 4 密度の高い指示、珍しい動き、曖昧なプロンプト、安全境界

予算が許すなら、各プロンプトを少なくとも3回実行してください。1回の実行は可能性を確認し、繰り返し実行することで、その挙動を製品が信頼できるかどうかを検証します。

プロンプトはプロバイダー非依存に保ってください。機能そのものが評価対象に含まれていない限り、1つのモデルだけが理解するようなプロンプト構文は避けます。すべての実行について、プロンプト、リクエストパラメータ、タスクID、タイムスタンプ、終了ステータス、出力URL、レビュアースコアを保存してください。

ByteDanceの公開Seedance研究では、指示の遵守、モーション品質、時間的一貫性、マルチショットのストーリーテリング、視覚品質といった次元が重視されています。これらは有用な評価カテゴリですが、チームは研究ベンチマークをそのまま複製するのではなく、観測可能な製品要件へと落とし込むべきです。

重み付けしたSeedance API評価スコアカードを使用する

以下のスコアカードは、一般的なテキストから動画への製品の出発点として機能します。ユースケースに異なる優先順位がある場合は、テスト前に重みを変更してください。

Dimension Weight Reviewer question
Prompt and instruction adherence 20 Did the clip follow the requested subject, action, setting, and camera direction?
Motion quality 20 Is movement natural enough for the intended product workflow?
Temporal consistency 15 Do objects, backgrounds, and visual identities remain coherent over time?
Composition and visual quality 10 Is the framing, lighting, detail, and overall presentation usable?
Reference consistency 10 When an image is supplied, does the result preserve the required subject or product traits?
Time to usable result 10 Does the full wait, including retries, fit the user experience?
Completion reliability 5 How often do tasks complete without transport, provider, or output failures?
Safety and reviewability 5 Can unsafe or unsuitable requests and outputs be detected before publication?
Cost per accepted clip 5 Is the real cost sustainable after rejected outputs are counted?

各品質次元を1〜5で採点し、重みを掛けたうえで、結果を100に正規化します。レイテンシや完了率のような運用指標は、記憶に頼って採点するのではなく、直接測定してください。

公正なSeedance API evaluationを行うには、複数のモデルを比較する際、どのプロバイダーが各クリップを生成したのかをレビュアーに知られないようにします。ファイル名をランダム化し、レビューシートからプロバイダーメタデータを削除し、スコア付けが完了してからモデルを開示してください。

生成コストではなく、受け入れ済みクリップあたりのコストを測定する

最も有用な動画生成コスト指標は次のとおりです。

cost per accepted clip = total generation spend / accepted clips

30件のタスクに60ドルかかり、レビューを通過した出力が12件だけなら、実効コストは生成1回あたり2ドルではなく、受け入れ済みクリップ1件あたり5ドルです。

また、次も追跡してください。

acceptance rate = accepted clips / completed clips

completion rate = completed clips / submitted tasks

cost per published asset = total generation spend / assets actually published

これにより、安価だが不安定な経路が、より高価でも実用的な出力をより高い頻度で生成する経路よりも良く見えてしまうことを防げます。また、モデル評価をチームの実際のクリエイティブ生産量や製品スループットに結びつけます。

Flatkey は現在、seedance-2.5 を従量課金ベースの早期アクセスとして提供しています。静的な数値を計画用スプレッドシートにそのまま写すのではなく、最新の商用情報はライブのモデルディレクトリ価格ページで確認してください。

非同期ワークフローを1つのアダプターの背後で正規化する

製品は、コードベース全体にプロバイダー固有のタスク状態を露出させるべきではありません。Seedance API を小さな動画生成アダプターの背後に置き、ライフサイクルを正規化してください。

type VideoJobState =
  | "queued"
  | "processing"
  | "succeeded"
  | "failed"
  | "expired";

type VideoJob = {
  id: string;
  state: VideoJobState;
  outputUrl?: string;
  errorCode?: string;
  submittedAt: string;
  completedAt?: string;
};

interface VideoGenerationAdapter {
  create(input: {
    prompt: string;
    imageUrl?: string;
    duration: number;
    resolution: string;
  }): Promise<VideoJob>;

  get(jobId: string): Promise<VideoJob>;
}

このアダプターは、デバッグのためにプロバイダーのタスク ID、元の終了ステータス、リクエストパラメータ、使用量データを保持すべきです。製品の他の部分は、正規化された状態に依存するようにしてください。

この境界により、Seedance API の評価はより誠実になります。製品フローを書き換えることなく、Seedance の品質と運用を別の動画ルートと比較できます。また、ポーリング間隔、タイムアウト予算、リトライ規則、Webhook 検証、移行ロジックを実装するための制御された場所も得られます。

より深い実装パターンについては、Seedance API チーム向けの安定した OpenAI 互換ベース URLのガイドを参照してください。ローンチ前には、キュー耐久性、冪等性、ストレージ、インシデント制御について、別のSeedance API 本番チェックリストを実行してください。

API の挙動を製品体験に対応づける

非同期の動画ルートは、同期的なテキストエンドポイントにはないユーザー体験上の判断を生みます。

待機状態

リクエストが受理されたことを示し、永続的なジョブ参照を提供してください。API が信頼できる進捗を公開していない限り、動画がもうすぐ完成すると示唆してはいけません。

タイムアウト状態

遅いタスクと失敗したタスクを分けて扱ってください。クライアント側のタイムアウトが、自動的に2回目の課金対象生成を作成してはいけません。再試行を許可する前に、元のタスクの確認を継続してください。

再生成

ユーザーが一度に1つの変数だけ、つまりプロンプト、参照画像、長さ、解像度を変更できるようにし、チームがどの要因で結果が改善または悪化したのか学べるようにしてください。

出力レビュー

クリップの横にプロンプトとパラメータを保存してください。生成されたアセットが公開または顧客向けワークフローに進む前に、内部レビュー状態を用意してください。

失敗時の文言

プロバイダーの失敗を、実行可能な製品メッセージに変換してください。たとえば、非対応入力、安全性による拒否、一時的なキャパシティ不足、期限切れアセット、再試行可能なサービスエラーです。サポートとエンジニアリングのために、生のコードは保持してください。

これらのUX状態をSeedance API評価に含めてください。モデルが優れたクリップを生成できても、レイテンシと失敗時の挙動を明確に説明できなければ、製品としては不適合である可能性があります。

評価に安全性とコンテンツレビューを追加する

テキストから動画への入力と出力は、製品固有の制御を通過させる必要があります。最低限、次を行ってください。

  • 入力メディアの種類、サイズ、出所を検証する;
  • 有料タスクを作成する前に、明らかに許可されない、またはサポートされていないリクエストを拒否する;
  • 誰がリクエストを送信したか、およびどのポリシー版が適用されたかを記録する;
  • 公開配信前に完了済みの出力をスキャンまたはレビューする;
  • プロンプト、参照、生成ファイルの保持および削除ルールを定義する;
  • 一時的な署名付きURLが製品の恒久的なアセット記録にならないようにする。

プロバイダーの安全性レイヤーがそのまま製品ポリシーと同じだと考えないでください。ユーザーが何をリクエストでき、生成コンテンツの何を保存、表示、または公開できるかを決定する責任は、引き続きアプリケーション側にあります。

5日間の製品チーム評価を実施する

1日目: 契約を確定する

ワークフロー、承認責任者、24件のプロンプト、パラメータ、スコアの重み付け、最大予算を決定します。Seedance 2.5のモデルページで現在のアクセス権を確認します。

2日目: アダプターを実装する

タスクを作成し、タスクIDを永続化し、安全にポーリングし、状態を正規化し、出力を保存します。中断されたクライアントセッションがジョブを失わないことを確認します。

3日目: 固定テストセットを生成する

制御されたパラメータで同じプロンプトセットを実行します。失敗や、レビュー担当者が即座に却下する出力も含め、すべてのリクエストを記録します。

4日目: ブラインドで採点する

少なくとも2人のレビュー担当者に、クリップを独立して採点してもらいます。受け入れ率、完了率、終端状態までのp50およびp95時間、加重品質スコア、承認済みクリップあたりのコストを算出します。

5日目: 判断して文書化する

次の4つの結果のいずれかを承認します。

  1. 限定ベータに進む — テスト済みのワークフローに対して。
  2. 制限付きで進む — プロンプトタイプ、長さ、参照入力、またはユーザーグループに制限を設ける。
  3. 評価を継続する — 修正したプロンプトまたはより大きいサンプルで。
  4. 進めない — 品質、運用、安全性、または単位経済性が合意した閾値を満たさないため。

この5日間の構成により、Seedance API評価が際限のないクリエイティブ実験に変わるのを防げます。

go/no-goの閾値例

テスト前に閾値を設定してください。仮想的な製品チームでは、次を求める場合があります。

メトリクス 閾値の例
加重品質スコア 100点中78点以上
受け入れ率 60%以上
完了率 97%以上
終端状態までのp95時間 製品が明示する待機ウィンドウ内
重大な安全性の失敗 ゼロ
承認済みクリップあたりのコスト 承認されたワークフロー予算内
参照破壊の失敗 ユースケース固有の上限を下回る

これらは例であり、普遍的なベンチマークではありません。ストーリーボードツールは、自動化された商品広告ワークフローよりも低い忠実度でも許容できます。価値は、測定可能な閾値を事前に定めておくことから生まれます。

この評価が再利用可能になる理由は何ですか?

プロンプトセット、スコアカード、アダプター、結果データセットをまとめてバージョン管理します。アクセス条件が変わったり、新しいSeedanceルートが利用可能になったりした場合は、同じパッケージを再実行します。

次の成果物を保持してください:

  • プロンプトセットのバージョン;
  • リクエストスキーマのバージョン;
  • モデルとルートのID;
  • 生成パラメータ;
  • 生のタスクライフサイクルのタイムスタンプ;
  • レビュー担当者のIDとブラインドスコア;
  • 受け入れ判定と却下理由;
  • コストと使用量の記録;
  • ポリシーバージョン;
  • 最終的なGo/No-Go判断。

これにより、Seedance API評価は一度きりのローンチ文書ではなく、長期的に使えるモデル運用資産になります。同じ構造は、1つのアクセス層の背後で動画、画像、音声、言語モデルを比較する場合の、より広範なマルチモーダルモデルルーティングにも対応します。

最終推奨

1つの生成クリップが印象的だからではなく、ワークフローの受け入れ契約を満たす場合にのみSeedance APIを使用してください。現在のルートを確認し、固定プロンプトセットをテストし、出力をブラインドで採点し、失敗も単位経済性に含め、非同期ライフサイクルはアダプターの背後に置いてください。

Flatkeyユーザーにとっての実践的な手順は次のとおりです:

  1. Seedance APIクイックスタートでキーとルーターを確認する;
  2. ライブモデルページで現在のseedance-2.5アクセスとリクエストフィールドを確認する;
  3. このガイドのスコアカードを実行する;
  4. 顧客展開の前に本番導入チェックリストを完了する。

規律あるSeedance API評価は、プロダクト、エンジニアリング、クリエイティブ、セーフティ、財務の各チームに対して、1つの共通した答えを与えます。それは、実際にリリースする予定のワークフローに対して、そのルートが信頼性高く許容可能な動画を生成できるかどうかです。

FAQ

Seedance APIは同期型ですか、それとも非同期型ですか?

Flatkeyの現在のseedance-2.5の例は非同期ワークフローを使用しています。アプリケーションは動画タスクを作成し、返されたタスクIDを保存してから、完了を確認するために動画タスクエンドポイントをポーリングします。

Seedance API評価で最も重要な指標は何ですか?

多くのプロダクトチームにとっては、受け入れ済みクリップあたりのコストです。この指標には生成コストと出力の有用性の両方が含まれるためです。これに受け入れ率、完了率、レイテンシ、重み付き品質スコアを組み合わせてください。

プロダクトチームは何件のプロンプトをテストすべきですか?

6つの行動グループにわたる24個のプロンプトが、実用的な出発点です。予算が許す場合は各プロンプトを複数回実行し、評価が可能性ではなく再現性を測定するようにしてください。

レビュー担当者は、どのモデルが各クリップを生成したかを知るべきですか?

いいえ、プロバイダーやモデルバージョンを比較する場合は知るべきではありません。ブラインドレビューは、ブランド嗜好と確証バイアスを減らします。

Seedance 2.5は画像から動画への変換をサポートしていますか?

Flatkeyのライブモデルページでは現在、seedance-2.5 がテキストから動画、画像から動画に対応しており、画像入力はオプションです。早期アクセスとしてマークされているため、実装前に現在のルートとフィールドを確認してください。

製品はタイムアウトした動画リクエストを自動的に再試行すべきですか?

すぐに新しいタスクを作成するべきではありません。まず既存のタスクIDを確認してください。クライアント側のタイムアウトは、プロバイダー側のタスクが失敗したことを意味しませんし、自動再送信によって重複作業や追加コストが発生する可能性があります。

Seedance APIの評価はいつ完了とみなせますか?

テスト前に合意したしきい値に対して、チームが品質、再現性、完了の信頼性、利用可能な出力までの時間、安全性のハンドリング、承認済みクリップあたりのコストを測定したときに完了です。