画像も、映像も、音楽も、手元のモデルで作る。そんな作例が、X に続けて流れてきました。画像・映像・音楽のそれぞれを手元のモデルで作った映像、ドラッグで画角を回せる漫画、時間が止まった中をカメラが飛び回るアニメ。使われたツールの公式情報とあわせて読んでいきます。
投稿の数字や感想は、投稿者本人の申告です。そのため「と本人は書いています」の形で紹介します。
自宅のGPUで、画像・映像・音楽を作る
最初は superalesha さんの映像です。
This video was created entirely at home on 1× RTX 3090.
— Alexey Fateev (@superalesha) 2026年10月8日
Images: Qwen Image 2.1, FLUX dev
Video: MiniMax H3
Music: YuE2 pic.twitter.com/SPsXt2OGHt
この映像は自宅で RTX 3090 1枚だけを使って作った、と投稿者は書いています 1。分担も明記されています。画像は Qwen Image 2.1 と FLUX dev、映像は MiniMax H3、音楽は YuE2 です 2。画像、映像、音楽のそれぞれに別のモデルを当てている。この組み合わせの妙が、いちばんのみどころです。
ツールの公式情報も見ておきます。
- MiniMax H3 は重みが公開されていて、ComfyUI の資料によればローカルで動かせます [[F2]]。ComfyUI でローカル実行できるとも書かれています [[F4]]。
- Qwen Image 2.1 は、開発元がオープンソース化したと README に書いています [[F32]]。
- FLUX.1 [dev] は重みが公開されています [[F62]]。ただしライセンスは FLUX.1 [dev] Non-Commercial License で、非商用の目的でのみ使えると定められています [[F61]] [[F63]]。
- YuE2 は重みが公開され [[F69]]、ComfyUI 用のノードと公式ワークフローがあります [[F73]]。モデル重みのライセンスは CC BY-NC 4.0(追加の作者許可つき)です [[F68]]。個人・クリエイター・音楽家は出力の収益化が無償で可能で、企業の商用利用は重みの商用ライセンスの相談が必要とされています [[F74]]。
作った映像を公開や収益化に使うなら、モデルごとにライセンスが違います。使う前に、それぞれの公式ページで条件を読んでおくのがよさそうです。たとえば MiniMax H3 は、ローカルで作った生成物の商用利用に MiniMax の商用ライセンスが必要だとされています 3。
ドラッグで画角が回る漫画
次は monoradio さんの漫画です。本人は返信で「ここで実際に試せます」と書き 4、claude.ai 上の「砂漠の灯台」というページを示しています。ページには「コマをドラッグで回す」と添えられています 5。
MiniMax-H3 + ORB360 LoRAで画角を自由に動かせる漫画を作ってみた。
— monoradio (@monoradio102) 2026年10月11日
キャラを参照画像で渡せば、顔も固定できる。 pic.twitter.com/FHfYf8TrZA
漫画の作り方について、本人は次のように書いています。使ったのは MiniMax-H3 と ORB360 LoRA。これで画角を自由に動かせる漫画を作った、と本人は書いています 6。キャラクターを参照画像で渡せば顔も固定できる、とのことです 7。流れは「ネーム → 画像生成 → 動かす」だったと、本人は返信に書いています 8。
ORB360 LoRA の側の公式情報も確認します。配布ページの README によれば、標準の Load LoRA ノードで MiniMax-H3 の Ref2VA に読み込んで使います 9。ライセンスは MiniMax H3 Community License Agreement です 10。「画角を自由に」は投稿者の言い方で、LoRA の仕様として書かれているわけではありません。
絵を描く人の作業とつながるのが、この作例のおもしろいところです。ネームから画像を作り、それを動かす。手描きの設定画やネームを起点にするなら、ペンタブレットがあると流れが作りやすそうです。
時間が止まった中を、カメラが飛び回る
最後は、さわさん(AI_swwww)のアニメです。時間が止まった中をカメラが飛び回る演出を、プロンプトで作れると投稿者は書いています。1本は15秒です 11。
AIアニメ、まだ静止画をちょっと動かすだけで終わってませんか。
— さわ|AI画像生成で月3桁継続中 (@AI_swwww) 2026年10月6日
いまは時間停止の中をカメラが飛び回る演出まで、プロンプトで作れます。
しかも1本15秒。
やり方とプロンプトはリプ欄から👇 pic.twitter.com/3nGiJ7gEPm
作り方は本人の返信にあります。
【やり方】
— さわ|AI画像生成で月3桁継続中 (@AI_swwww) 2026年10月6日
やることはこの4つです。
① 設定画:GPT Image 2.5でオリキャラの設定画を1枚(正面・斜め・横・後ろ、表情3つ、小物)
② 動画:Seedance 2.5(Higgsfield)の参照モードに設定画を渡す。16:9・15秒
③ プロンプト:「走る→転ぶ→時間停止→カメラが飛ぶ→時間が戻る」を秒単位で書く…
手順は次の通りです。
- 設定画: まず GPT Image 2.5 でオリジナルキャラクターの設定画を1枚作る(正面・斜め・横・後ろ、表情3つ、小物) [[C66]]
- 動画: Seedance 2.5(Higgsfield)の参照モードに設定画を渡す。16:9・15秒 [[C67]]
- プロンプト: 「走る→転ぶ→時間停止→カメラが飛ぶ→時間が戻る」を秒単位で書く [[C68]]
- コツ: 止まっている間は「カメラ以外は何も動かない」と明記し、まばたき・髪・服の揺れも止める [[C69]]
投稿者が挙げているのは Higgsfield 経由の Seedance 2.5 などのサービスで、手元で動かす構成とは書かれていません 12。
そのうえで、ここからは記者の意見です。設定画で見た目を固定し、時間の流れを秒単位で書き分けるという考え方は、手元の動画生成に持ち込んでも役に立ちそうです。上の MiniMax H3 の作例のように、参照画像でキャラクターの顔をそろえる使い方とも相性がよさそうに見えます。
自分の机でやるなら
ここまでの作例には、投稿者が手元の GPU を挙げているものと、サービスを経由して作ったものが混ざっています。「全部を自分の机で」と考えたとき、NVIDIA が RTX Spark について言っていることを見ておきます。
- NVIDIA の製品ページによれば、画像や動画を自分のデバイスで、好きなだけ生成できます。サブスクリプションも、プロンプトごとの料金もありません [[F101]]。
- 同じページで NVIDIA は、ローカルで動かすと、すぐに試せる、API 料金がかからない、データが手元に残るという利点があると説明しています [[F102]]。
- NVIDIA のブログによれば、RTX Spark は NVIDIA CUDA プラットフォーム全体を動かします [[F104]]。クリエイター向けには、第5世代 Tensor コア(NVFP4 対応)、ハードウェアによる AV1、4:2:2 ビデオのエンコードとデコードが挙げられています [[F105]]。
今後の予定も出ています。NVIDIA によれば、RTX Video Frame Generation を ComfyUI に提供する予定で、Adobe は Photoshop と Premiere を再設計し、これらの更新は RTX Spark とともにこの秋に届くとされています 13。Adobe Premiere については、NVIDIA が Adobe と提携し、RTX Spark 向けに再設計していると発表しています 14。ComfyUI の共同創設者 Yannik Marek 氏の談話は、NVIDIA のブログ(日本語版)に載っています。ComfyUI のユーザーは、複雑なマルチモーダルのワークフローを実行し、ポータブルなデバイス上でかつてないスピードで超高解像度の画像とビデオを生成できるようになる、という将来形の話です 15。
ここで紹介した作例で、RTX Spark 搭載機で作ったと書かれているものはありません。MiniMax H3 や YuE2 を RTX Spark 搭載機で使いたい場合は、先にそれぞれの公式情報で対応環境を確かめてください。
RTX Spark 搭載のノートの例です。
映像の書き出しが増えてきたら、置き場所を用意しておくと安心です。作例のように画像、映像、音楽を行き来するなら、書き出し先を分けておくと整理しやすくなります。
次に読む
音楽の側を深掘りするなら、YuE2 を手元で動かす作例の記事へ。YuE2 を手元で動かす音楽の作例
映像や音楽とは別の方向では、AI エージェントに Blender を任せる作例も、同じ「手元で作る」の続きとして読めます。
