DOCUMENT · 2.8 KB
docs/provider-research.md
Workspace snapshot · 09/04 14:52
Provider Research — 2026-08-26
結論
Google一社を標準にしない。Text-to-Video、Image-to-Video、Reference-to-Video、開始終了フレーム、延長、編集、機密素材を別能力として扱い、用途別に選ぶ。
Video Arenaの順位は一般ユーザーの匿名比較として有用だが、PENGINのブランド素材、縦動画、日本語発信、編集可能性、原価を保証しない。最終判断は実素材比較で行う。
現在の候補
| Provider | 初期用途 | API概算 | 注意点 |
|---|---|---|---|
| Gemini Omni Flash | Text-to-Videoフック | 約$0.125/秒、720p | 3〜10秒。公開前の新モデルなので可用性を毎回確認 |
| FLUX 3 Draft | 構図・動きの安価な試作 | $0.06/秒、720p | Draft採用後に同じキャッシュをEnhanceできる点が強い |
| FLUX 3 | 1080p仕上げ、キーフレーム | $0.17/秒 720p、$0.29/秒 1080p | Draft Enhanceの実再現性をPENGIN素材で確認する |
| Kling O3 Standard | 安価な制御、開始終了、複数ショット | $0.084/秒、音声なし | Arena総合順位だけでなく制御性で評価 |
| Seedance 2.0 Fast | 複雑な動き、物理、複数参照 | $0.2419/秒、720p | 最大15秒。生成単価が高いためDraft用途には使わない |
| MiniMax H3 | Image-to-Video、参照一貫性 | $0.26/秒、2K | 画質は有望だが入力動画を使う場合は追加原価に注意 |
| Veo 3.1 | 延長、最終フレーム、機密素材 | Tierにより変動 | Vertex AIのデータ条件と既存GCPを活かす特殊用途 |
運用判断
- 非機密の比較課題はfalの統一APIを利用する
- 顧客名、未公開画面、個人情報を含む素材はfalへ送らずVertex AIへ限定する
- 日本語ナレーションは動画モデルのネイティブ音声を正本にしない
- Google Chirp 3 HDを先に試し、ブランド音声として不足する場合だけElevenLabs Creatorを1か月利用する
- 文字、ロゴ、図解、実UI、CTAはRemotionで合成する
- Sora 2 APIは終了予定のため中核にしない
Sources
- https://arena.ai/leaderboard
- https://fal.ai/models/google/gemini-omni-flash
- https://fal.ai/learn/tools/how-to-access-flux-3-on-fal
- https://fal.ai/models/fal-ai/kling-video/o3/standard/image-to-video
- https://fal.ai/models/bytedance/seedance-2.0/fast/reference-to-video
- https://fal.ai/minimax-h3
- https://ai.google.dev/gemini-api/docs/video
- https://docs.cloud.google.com/vertex-ai/generative-ai/docs/vertex-ai-zero-data-retention
- https://cloud.google.com/text-to-speech/pricing
- https://elevenlabs.io/ja/pricing
価格換算
コード上の予算予約は為替・税・価格改定のバッファを含め、1 USD = 165円で切り上げる。実支出はProviderの実請求額を記録し、概算値を学習データへ混ぜない。