01
静止画を選ぶ
顔やキャラがはっきりしているほど良いです。写真、イラスト、アニメ、ペットが使えます。
ライブツール
画像 + 音声を入れて MP4 を出力。公式 Wan-AI Hugging Face Space を使うため、DashScope キーは不要です。
公式 Space を読み込み中です。スリープ中のデモは起動に1分かかることがあります。
概要
Wan 2.2 Speech to Video は静止画と音声から、話す・歌う・演じる動画を生成します。Wan 2.2 ファミリーの S2V 版で、トーキングフォト、歌唱キャラ、音声駆動アバター向けです。
口だけを動かすリップシンクと違い、音声が表情、頭部、しばしば上半身まで駆動します。トーキングフォト、歌唱写真、音声から動画、AI リップシンク、トーキングアバターの検索意図はほぼこの用途です。
デモに必要なのは画像、音声、解像度だけです。
01
顔やキャラがはっきりしているほど良いです。写真、イラスト、アニメ、ペットが使えます。
02
動画の長さは音声に従います。ノイズよりクリアな声が口の動きを読みやすくします。
03
まず試すなら 480P。720P はより鮮明ですが公開キューは遅くなります。
同じ Image + Audio の流れでトーキングフォト、歌唱、アニソン、ペット会話が作れます。
ポートレートにセリフを与えます。説明、挨拶、トーキングアバター向け。
顔とボーカルを組み合わせます。歌唱はパフォーマンスとして扱われます。
線がはっきりしていれば、イラストやアニメキャラも歌に合わせて動かせます。
ペット写真と短い声が定番です。動物を大きく写してください。
既存映像の口だけ合わせたいならリップシンクで足りることがあります。S2V は静止画と音声から新しい動画を作ります。
| 項目 | Wan 2.2 S2V | 一般的なリップシンク |
|---|---|---|
| 動き | 音声で顔・表情・身体を駆動 | 既存クリップの口形が中心 |
| 入力 | 静止画 + 音声 | 既存動画 + 音声 |
| スタイル | 会話・歌唱・パフォーマンス | 多くは会話のみ |
| 向いている用途 | トーキングフォト、歌唱、音声から動画 | 手元の映像の台詞差し替え |
この公開デモにテキストプロンプトはありません。画像と音声が演出します。公式 API に style / prompt が付いても、この組み合わせは有効です。
公式 Wan-AI 公開 Hugging Face Space を使うため、API キーなしで Image + Audio を試せます。無料デモバックエンドであり、本番枠の保証ではありません。
ありません。北京リージョンの wan2.2-s2v は無料枠なしです。古い「100秒無料」は使わないでください。
このデモでは不要です。バックエンドは Space 運営側です。14B の Apache 2.0 重みを自前運用するのは別経路で、公式には非常に大きな GPU が必要です。
公開 Space はスリープ、制限、停止があり得ます。480P、短い音声、公式タブ、ModelScope 予備を試してください。
関連しますがより広いです。リップシンクは既存動画の口を直すことが多く、S2V は静止画と音声から新しい会話・歌唱動画を生成します。
安定した本番 API としては向きません。需要を確認してから有料プロバイダを使ってください。このページは機能検証用です。