AIを活用してショートドラマ、短編映画、または高品質な広告CMを制作しようとする映像ディレクターやクリエイターの90%以上が、シーン2の段階でプロジェクトを断念しています。その原因は画質ではありません。現在の生成モデルはネイティブで映画級の4K解像度を出力できます。最大のボトルネックは、カットが切り替わるたびに主人公の顔や骨格が別人に変貌してしまう現象(業界で恐れられる「アイデンティティ・ドリフト / Identity Drift」)です。2024年から2025年にかけて、制作者はテキストの形容詞を何十回も書き直したり、400MBの不安定なLoRAを何時間も学習させてGPU費用を浪費していました。2026年9月、この問題は解決しました。一貫性はテキストで指示するものではなく、「5軸アンカー行列」によって潜在空間に決定論的に注入するものへと進化しました。ByteDance Seedance 2.0 (IR2V)やKling 3.0 Elementsと、NanoBanana 2で生成した正規基準シートを組み合わせることで、40カット以上の異なるアングルでも俳優の生体特徴を94%以上の保持率、破棄率6%未満で完全に維持できます。
技術定義:キャラクターの一貫性とIdentity Drift
Identity Drift(アイデンティティ・ドリフト)とは、連続する生成ステップにおいてAI生成キャラクターの生体情報(瞳孔間距離、鼻梁形状、頬骨の立体角、骨格比率)が確率的に崩壊・変形する現象を指します。絶対的なキャラクターの一貫性は、マルチアングル正規基準シートから抽出された不変特徴ベクトルを動画拡散モデルの空間クロスアテンション層に直接注入するCross-Attention Latent Conditioningによって実現され、照明、カメラワーク、衣装の変更から顔の生体構造を完全に切り離します。
1. 「魔法のプロンプト」という幻想と、言葉で顔を固定できない数学的理由
DXBuilderの動画生成パイプラインを最初に設計した際、私も多くの初心者が陥る罠に嵌まりました。テキストボックスの中で主人公の顔の特徴を一から十まで細かく書き連ねる方法です。
「28歳の女性、北欧系の顔立ち、アーモンド型の深いエメラルド色の瞳、シニヨンにまとめたライトブラウンの髪、左頬骨の上に小さなそばかす、シャープな顎ライン…」
シーン1(昼間のバストショット)では息をのむほど素晴らしい結果が得られました。しかし、シーン2(夜間の青いネオンに照らされた切り返しショット)に進んだ瞬間、モデルは全くの別人を出力しました。見た目年齢が5歳上がり、鼻の形が変わり、そばかすは消失しました。
この失敗の背景には、明確な数学的理由が存在します。それがアテンション・エントロピー(トークン希釈)です。Transformerベースの動画拡散モデル(Wan 3.0、Seedance 2.0、Kling 3.0など)では、アテンション機構が有限の重み予算を入力トークン全体に分配します。プロンプトを衣装やカメラ、背景の装飾語で埋め尽くすと、顔の特徴に割り当てられるアテンションの重みは12%以下に低下します。その結果、モデルは不足した潜在座標をランダムな初期ノイズから捏造せざるを得なくなります。
2. 5軸正規アンカーシート手法(@Hero Character Sheet)
30秒のCMや長尺ドラマ全編で同一のデジタル俳優を破綻なく制御するには、「5軸正規アンカーシート」が不可欠です。
DXBuilderの画像エンジン(NanoBanana 2)では、16:9のパノラマ4K解像度で次の5つのアングルを1枚に統合して出力します:
- 第1軸 — 正面フラット(正射投影): ニュートラルなダークグレー背景(#1B1B21)、柔らかな4500Kスタジオ照明、正面直視。顔の対称性、瞳孔間距離、顎骨の幅を固定します。
- 第2軸 — 3/4アングル(キーライト): 顔を45度傾けたハイライト。鼻梁の高さと頬骨の立体的な凹凸をモデルに学習させます。
- 第3軸 — 真横プロフィール(90度): 横を向いた際にペラペラの紙のように平坦化する現象を防ぐために極めて重要です。
- 第4軸 — 表皮テクスチャ・マクロ: 肌のキメ、毛穴、虹彩のディテールに迫る接写。不自然な「プラスチック肌」への退行を防ぎます。
- 第5軸 — 感情スペクトラム(発話・緊張): 発話時の口の形状と集中した表情。これにより、骨格を保ったまま表情筋を自然に変形させることが可能になります。
3. トークン分離:顔を変えずに衣装とロケーションを完全に切り替える
次なる課題は「衣装の癒着(Wardrobe Entanglement)」です。基準シートで青いチェックシャツを着ているキャラクターを、シーン3で宇宙服に着替えさせようとすると、チェック柄がヘルメットに混ざったり、宇宙服に合わせて顔つきが変わってしまう現象です。
2026年のプロフェッショナル現場では、「構造化トークン分離」を用いて解決します:
混沌とした単一指示文:
「写真の青いシャツのマーカスが、サイバーパンク都市で黒い革ジャケットを着てバイクに乗っている」
結果:生成の68%で顔立ちが変形。
独立した条件スロット:
[IDENTITY: @Actor_Marcus] (純粋な生体参照テンソル)
[WARDROBE OVERRIDE: distressed black leather motorcycle jacket]
[ENVIRONMENT: Neo-Tokyo rainy street at night, neon reflections]
結果:95%の生体保持率で完璧な着せ替えに成功。
4. 2026年エンジンベンチマーク:顔面保持率、安定性、および実際の制作コスト
DXBuilderの開発ラボでは、主要モデルに対して同一女性キャラクターを極端な4つの環境(リビング、吹雪、カーチェイス、キャンドルディナー)で20カット連続生成する耐久テストを実施しました。
| 動画生成エンジン | アンカー技術 | 顔面保持率 (%) | 衣装適応力 | 1カット平均コスト | ボツ率(破棄率) |
|---|---|---|---|---|---|
| Seedance 2.0 (IR2V) | Spatial Latent Injection | 96.2% | 極めて高い | 約50〜90円 | 4.8% |
| Kling 3.0 Omni Elements | Multi-Reference Fusion | 93.8% | 良好 | 約70〜120円 | 6.2% |
| Wan 3.0 Multimodal | Cross-Attention Frame Lock | 88.5% | 標準 | 約40〜60円 | 14.5% |
| 従来型 Text-to-Video | テキストプロンプトのみ | 18.4% | 制御不能 | 約400円超(リテイク過多) | 81.6% |
特筆すべきは最下段のデータです。テキストプロンプトだけに頼るクリエイターは、GPU予算の80%以上を失敗した生成でドブに捨てています。DXBuilderで5軸アンカーとSeedance 2.0を連動させれば、初回成功率は95%をマークします。
5. スタジオ実戦プロンプトテンプレート集(コピーして使用可能)
私たちが日常的に活用している3つの実戦テンプレートです。DXBuilderのキャラクタースタジオや動画スタジオにそのまま貼り付けて利用できます:
A comprehensive 5-angle cinematic character reference sheet, wide 16:9 format. Single subject: a 32-year-old female architect with olive skin tone, dark hazel eyes, sharp defined jawline, subtle micro-freckles across bridge of nose, hair in sleek architectural low bun. Five distinct panels arranged horizontally from left to right: 1. Flat orthographic front view, neutral expression, eye level, studio grey backdrop (#1B1B21). 2. Three-quarter view (45 degrees), soft 4500K key light, subtle confident smirk. 3. Profile view (90 degrees), clean silhouette, precise nasal bridge and chin projection. 4. Macro close-up on eye and cheek, revealing hyper-realistic epidermal pore structure, iris striations. 5. Action expression panel, slight open-mouth dialogue phoneme, intense focus. Consistent clean neutral lighting throughout, 8K hyper-detailed, Arri Alexa 65 aesthetic, master studio anchor sheet, no text, no borders.
[CAMERA]: Slow cinematic push-in on 50mm anamorphic lens, shallow depth of field, f/1.8. [ACTOR LOCK]: Strict biometric alignment to reference anchor @Hero_Sheet, identical facial bone structure, olive skin tone, dark hazel eyes. [ACTION]: Subject turns head smoothly from profile to 3/4 angle, subtle micro-expressions of shock transitioning into determined resolve, natural breathing, subtle eyelid flutter. [LIGHTING]: High-contrast noir lighting, warm amber backlight cutting through cinematic haze, cold cobalt fill light on side of face. [AUDIO CUES]: [AUDIO: subtle rustle of heavy wool trench coat, muffled distant thunder, slow ambient drone, no spoken dialogue]. Ultra-smooth 30fps motion, zero facial warping, photorealistic hair physics.
[BIOMETRIC LOCK]: Locked to facial identity matrix of @Hero_Sheet, exact facial proportions, eye spacing and nose shape preserved with zero drift. [WARDROBE OVERRIDE]: Fully replace clothing with a weathered tactical astronaut pressurized suit, matte carbon fiber plates, glowing amber status telemetry on chest collar. [ENVIRONMENT]: Interior of a depressurized orbital airlock, floating crystalline ice particles catching orange emergency strobe light reflections, deep space visible through thick reinforced glass window. [MOTION]: Slow-motion floating micro-gravity drift, subtle head rotation, eyes scanning cockpit instruments, helmet visor up revealing clear facial features. Photorealistic volumetric lighting, zero wardrobe bleeding into facial skin, 4K rendering.
6. DXBuilderにおける一貫性の自動化(肥大化したLoRA不要)
DXBuilderを開発した最大の目的は、映画制作者やクリエイターがCivitaiからギガバイト単位のモデルを何十個もダウンロードしたり、ComfyUIの複雑なノード配線に頭を抱えたりする時間をゼロにすることでした。
DXBuilderの操作は直感的です:
- キャラクタースタジオでシート生成: テキストを入力するか写真を1枚アップロードするだけで、システムが自動的に4Kの5軸アンカーシートを出力します。
-
プロンプト内で「@」メンション: 動画スタジオやStory Labで
@俳優名を入力するだけで、生体テンソルが自動注入されます。 - 自動シーンハンドオフ(Scene Handoff): Story Labでは、シーン1の最終フレームがシーン2の空間シードとして自動継承され、カット変わりの照明や姿勢の一貫性を保ちます。
今すぐシネマティックプリセットをお試しいただくか、制作規模に応じたクレジットプランをご確認ください。
7. AI俳優の一貫性に関するよくある質問(FAQ)
暗い夜のシーンになると顔が崩れてしまうのはなぜですか?
拡散モデルはコントラストのエッジを頼りに顔の特徴点を照合します。光量が不足すると初期ノイズが生体信号を打ち消してしまうため、プロンプトに顎のラインを際立たせるリムライト(輪郭光)やネオンのバックライトを必ず指定してください。
自分自身や実在の俳優の写真からデジタルツインを作成できますか?
はい。キャラクタースタジオに明るい正面写真を1〜3枚アップロードするだけで、追加のモデル学習なしにSeedance 2.0やKling 3.0と完全互換のマルチアングル基準シートを自動生成できます。
基準シートに最適なアスペクト比と解像度は?
16:9のワイド画面、解像度3840x2160(4K)を強く推奨します。1:1の正方形では、肌のキメや瞳の細部を犠牲にせずに5つのアングルを並べる十分な横幅が確保できません。
2026年になってもLoRAの追加学習は必要ですか?
商業案件の95%においては不要です。LoRA学習は1人あたり30〜60分のGPU時間を消費し、動きの中で顔が硬直する原因になります。現在の直接潜在注入(IR2V)技術なら、同等以上の精度を数秒かつ低コストで実現できます。
Filipe Heitor
DXBuilder創設者・チーフアーキテクト • ポルトガル・リスボン
スタジオでの実証テストに基づき、AI動画アーキテクチャ、物理拡散モデル、デジタル演出論について定期的に発信しています。ワークフローの共有はDXBuilderコミュニティでお待ちしています。




