クラウドのサービスではなく、手元の機械で大きなAIモデルを動かす。X(旧Twitter)には、そうした試みの投稿があります。この記事では、DGX Spark やその互換機、RTX 5090 などを使った最近の投稿と、Microsoft の発表を紹介した投稿を取り上げ、何と何を組み合わせて何ができたのかを見ていきます。
なお、DGX Spark と、RTX Spark を載せた Windows PC は別の製品です。ここで紹介する作例の多くは DGX Spark や互換機、RTX 5090 でのもので、RTX Spark 搭載機で同じことができるかどうかは、この記事では扱いません。
また、数字や感想の多くは投稿者本人の申告です。そのため「と本人は書いています」という形で紹介します。
声つきの動画を、途切れず作り続ける
最初は、動画生成モデルの MiniMax H3 と、音声合成の Irodori を組み合わせたデモです。キャラクターが声つきで話す動画を、止まらずに作り続けるAITuber風の構成になっています。
ローカルMiniMax H3で、声つきの約7秒動画をリアルタイムに連続生成してみました。RTX 5090+DGX Spark互換機3台を使いました。
— 鈴木憂一 | Highdrama (@yu_ichi_suzuki) 2026年10月5日
動画の完成間隔は平均約6.9秒。RTX 5090が動画を生成している間に事前・事後の処理をDGX Sparkが行い、途切れずに再生します。
RTX… pic.twitter.com/ogjmQUKHJn
投稿者によれば、使ったのは RTX 5090 が1台と、DGX Spark 互換機が3台です 1。ここで書かれているのは DGX Spark 互換機であり、DGX Spark そのものではありません。役割は分かれていて、RTX 5090 が動画を生成している間に、DGX Spark(互換機)が前後の処理を受け持ち、途切れずに再生すると本人は書いています 2。動画の完成間隔は平均約6.9秒だと本人は書いています 3。
この構成で、動画は約7秒単位で作られるようになり、RTX 5090 単体のときの15秒単位から短くなったそうです 4。PDMD 2step LoRA では音声に問題があったため、先に Irodori で声を作る方式にしたそうです 5。口の動きを合わせる手順も工夫されています。先に Irodori で音声を作り、MiniMax H3 の音声VAEで音声latentという形に変換して、生成時のガイドとして渡す、というものです 6。解像度は 320×576 から 384×704 に上げられたとのことです 7。
使われているツールについては、MiniMax H3 はオープンウェイトで、ローカルで動かせるとComfyUIの資料にあります 8。ライセンスは MiniMax H3 Community License Agreement で 9、ローカルで作った生成物を商用に使うには MiniMax の商用ライセンスが必要です 10。Irodori-TTS のコードは MIT ライセンスです 11。
投稿者自身が弱点も書いています。コメントと返答文は事前に用意したデモで 12、1つの返事を作るのに約14.4秒、再生待ちを含めると約16秒かかるそうです 13。返答までの待ち時間は、まだこれからの課題ということになります。実際にAITuberとして配信するなら、もう1台モデルを動かすPCが必要になりそうだとも書いています 14。冒頭2本の挨拶は事前に生成したもので、ドット絵の見た目は後処理だそうです 15。
動画生成を、軽く速くする試み
MiniMax H3 を速く、小さくした FastH3 についての発表もありました。これは Hao AI Lab の FastVideo による、開発元からの発表です。
1/8) FastVideo FastH3 now runs on a single consumer machine: @NVIDIA RTX GPUs 💚, DGX Spark and @Apple Silicon 🍎
— Hao AI Lab (@haoailab) 2026年10月6日
FastH3 V2 beats base @MiniMax_AI H3 in 8 steps. A 5 s 480p clip with audio takes 15 s on one RTX 5090.
We also release FastH3 Trim: 4.2× smaller than base H3, and… pic.twitter.com/Ma9NZsfr3t
投稿によると、FastH3 V2 では、5秒・480p・音声つきのクリップが RTX 5090 1台で15秒で作れます 16。H3 本体より小さくした FastH3 Trim は、最小8GBのGPUメモリで動くとされています 17。一次資料のREADMEでも、Trim は実験的な枝刈り版で、最小8GBのGPUメモリで動くと説明されています 18。投稿に載ったクリップは、すべてローカルで生成したと書かれています 19。
対応環境は、READMEに RTX 5090 などのGPU、DGX Spark、Apple Silicon が挙げられています 20。DGX Spark については、CUDA 13 で動くと説明されています 21。FastVideo 自体は Apache-2.0 ライセンスで 22、DGX Spark への導入手順が用意されています 23。DGX Spark は ARM64 の機械で、導入手順によれば、その環境向けの一部の部品はソースからビルドする必要があります 24。
長時間、同じ機械で考え続けさせる
次は、DGX Spark で Qwen3.8-27B を動かした例です。庭園のデザインを考えさせ、実装を繰り返させ続けるデモです。
Running Qwen3.8-27B (the dense model, not Qwen Flash) on a single DGX Spark.
— 0xBakeer (@0xBakeer) 2026年9月30日
Thanks to optimized caching algorithms and the StairCut method, the ~150k context prefill takes just milliseconds, and decoding speeds hit around 50–90 tok/s depending on the task.
In this clip, I… pic.twitter.com/4Mhn9578CH
投稿者は、キャッシュの工夫と StairCut という手法で、約150kの長い文脈の読み込みがミリ秒単位で終わると書いています 25。文章を出力する速さは、作業の内容により約50〜90 tok/s だそうです 26。録画は5時間連続で動かしたあとに行ったとのことです 27。
Qwen3.8-27B は Apache-2.0 ライセンスのオープンウェイトモデルです 28 29。長い作業を手元の機械に続けさせられるかどうかは、ローカルでAIを使ううえで気になるところで、その一例として読めます。
複数の機械を束ねて、全端末から使う
次は、モデルそのものではなく「使い方」の工夫です。
single most useful thing for my local ai setup that made life easy is my 2x DGX Spark becoming one serving box for every device i own
— Sudo su (@sudoingX) 2026年9月30日
here is how i do it:
> 1. the two sparks run one vLLM server together with one endpoint, i use dgx sparks, you can use any nodes that can run an… https://t.co/bqNaCMQ2Ps pic.twitter.com/lC4m9AE0Wv
投稿者は、DGX Spark を2台使い、1つの窓口(エンドポイント)を持つ vLLM サーバーとして動かしています 30。そこに Tailscale で手持ちの端末をすべて同じネットワークに入れ 31、チャットアプリ、コーディングエージェント、スマホのボットをすべて同じ窓口につなぐ、という構成です。窓口は OpenAI と Anthropic の形式で話すので 32、チャットアプリ・コーディングエージェント・スマホのボットのどれをつないでも同じモデルと話せる、と本人は書いています 33。
さらに、モデル名の代わりに「local」と呼べるようにしてあるので、サーバー側でモデルを替えても、端末側の設定は変えずに済むそうです 34。投稿の時点で配信しているのは GLM 5.3-Flash です 35。投稿の時点では同時に1件ずつ処理する設定なので、全端末が一度に投げると順番待ちになる、とも書かれています 36。
vLLM は Apache-2.0 ライセンスで 37、NVIDIA が DGX Spark での導入手順を公開しています 38。
Windows PC でも、大きなモデルを手元に
最後は少し毛色が違います。これは実機で動かした本人の報告ではなく、Microsoft の発表を第三者の Rohan Paul さんが紹介した投稿です。
Microsoft today showcased DeepSeek V4 Flash, a 284B-parameter open-weight model, runs locally on a Windows PC once quantized to 1.6 bits, which brings it down to about 60GB of memory.
— Rohan Paul (@rohanpaul_ai) 2026年10月7日
Their new Surface Laptop Ultra, built on Nvidia's RTX Spark chip with up to 128GB of unified… pic.twitter.com/SGhAz9ehaT
紹介によると、Microsoft が見せたのは、284Bパラメータのオープンウェイトモデル DeepSeek V4 Flash が、1.6ビットに量子化すると約60GBになり、Windows PC 上でローカルに動く、というものです 39。そして、RTX Spark を搭載した Surface Laptop Ultra の、メモリ容量が大きい構成ならこのモデルが載る、という書き方になっています 40。
DeepSeek V4 Flash 自体は MIT ライセンスで公開されています 41。ただし、投稿は「載る余地がある」という紹介にとどまっていて、実際の使い心地までは分かりません。
こういう使い方を考えている人へ
ここまでの例を並べると、手元の機械に求められていることはいくつかに分かれます。
- 動画や声の生成のように、複数の処理を分担させたい
- 長い作業を、時間をかけて任せたい
- 大きなモデルを動かし、手持ちの端末から共有して使いたい
Windows で使える RTX Spark 搭載機には、ノートと小型デスクトップがあります。ここで紹介した作例が RTX Spark 搭載機でそのまま動くかどうかは、使うツールの対応しだいです。選ぶ前に、各ツールの公式情報で対応環境を見ておくと安心です。
作例の多くで使われていたのは DGX Spark とその互換機です。
どの機械を選ぶにしても、決め手は「動かしたいモデルが載るメモリがあるか」と「自分の使うツールが対応しているか」です。投稿者の申告を見ても、速度や待ち時間は用途ごとに大きく違います。
