天天資訊:吹爆開源!RunningHub讓MiniMax H3滿血提速12倍,本地部署照樣起飛
MiniMax H3是真強也是真火啊。
【資料圖】
開源還能打,在AI視頻圈也算是獨一份了。
模型底座強成這樣,開發者們自然也閑不住,開始琢磨怎么把它玩得更爽。
所以MiniMax前腳剛把H3開源,后腳各種工作流、ComfyUI節點、垂直優化玩法就已經冒了出來。
這不,一站式AIGC創作平臺RunningHub就盯上了一個大家都特《急急急》的事兒:
讓H3跑快點。
咋說呢,模型越好用人越忍不住多抽幾次,結果一抽一個大等待。
靈感一上頭,創意改起來只要十幾秒,下一版都已經在腦子里剪完了,結果屏幕上的這一版還在轉……
于是乎,RunningHub干脆給H3踩了腳油門,直接朝著等待時間砍了一刀。
同樣生成5秒、1344×768的視頻,在4張RTX 6000D上,原始BF16 50步方案耗時348.8秒,差不多6分鐘
RunningHub H3 Lightning完整加速之后,只需要28.7秒
好家伙,前后約12倍提速,生成耗時減少約92%,卻依舊能保留BF16數值精度。
現在,RunningHub已經把整套玩法放GitHub上開源了,任何創作者都能開箱即用!
(https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/)
快12倍的H3是啥體驗
不光是5秒視頻,就算是15秒、雙參考圖,RunningHub H3 Lightning依舊能給你猛猛提速。
在8張RTX 6000D環境下,讓H3做一個15秒、分辨率768×1344的視頻,純文字生成大約需要48秒、雙參考圖生成約73秒。
也就是說,一條15秒的圖生視頻,可以打進“1分鐘出結果”這個時間尺度了。
而且在RunningHub H3 Lightning這兒,AI加速可不等于質量劣化。
整套加速方案還全程保留BF16滿血精度,沒有走降精度換速度的“捷徑”。
一個本來就已經很能打的模型,又被狠狠優化了一波,咱必須得體驗一把!
我先試了一個5秒、768P的文生視頻,直接來個大動作。
場景放在沙漠,一個女越野摩托車手原地起步,隨后高速沖上沙丘,騰空、落地,再接一個大幅甩尾。
嫌這還不夠,我又給鏡頭加了點活兒。
先低機位側面追車,隨后繞到正面倒退跟拍,最后讓摩托直接從鏡頭旁邊沖過去。
從點擊生成到出片的實際用時約為30s,人、車、沙塵的運動邏輯挺連貫。
落地的時候車身有明顯的下沉和回彈,騎手的重心也跟著往下壓了一下,還有塵土的飛揚看著也挺真實。
我預設的機位也都安排妥了。
視頻地址:https://mp.weixin.qq.com/s/bygc8puWmTmN2KSt7otkwA
其實,除了畫面質量高之外我最大的感受是,等待間隙我甚至都沒刷完一個某音視頻……
確實是絲滑。
不過5秒還是短,咱還得上強度。
再試試15秒的圖生視頻,這次我喂了一張吉卜力風格的參考圖。
△圖片AI生成
原本是一人一狗背對著鏡頭坐在草地上,現在咱讓他倆跑起來。
少年從草地上起身,直接向山坡前方奔跑;金毛也得跟著起來,一邊跑一邊跳;少年中途還要張開雙臂、轉身繼續跑。
鏡頭從背后推進,再切到側面跟拍,最后拉遠,把整個山谷重新帶進畫面。
15秒長視頻的生成時間就比較久了,從點擊到出片大概88秒
從坐著到起身,再到邁步加速,動作之間有比較明顯的銜接;金毛也沒有淪為一張跟著人物平移的貼紙,自己完成了起身、奔跑和跳躍。
更關鍵的是,15秒跑下來,這一人一狗還基本是原來那一人一狗。
少年的黃色外套、藍色褲子、黑色頭發這些主要特征一直都在,金毛的體型和毛色也沒有跑到后半段突然換了個品種。
而且鏡頭轉完一圈后,遠處的湖泊和夕陽依舊在畫面中。
視頻地址:https://mp.weixin.qq.com/s/bygc8puWmTmN2KSt7otkwA
當然了,你要是真盯著看也還是能挑出毛病。狗在快速跳躍時,四肢動作偶爾會有點“硬”,但是倒也不會特別出戲。
本來打算收工了,我又突然冒出來一個想法,晴天不要了,給我下雨。
沒錯咱創作的時候靈感就是嘎嘎跳躍!
少年得站起來撐傘,在草地上跑,再突然停下轉一圈;金毛繼續繞著他跑,還得從旁邊跳過去。
與此同時,原來的遠山和湖泊還得留住。
二次創作的時間變短了,也就50秒左右,最后畫面遠處還出現了一抹彩虹~
視頻地址:https://mp.weixin.qq.com/s/bygc8puWmTmN2KSt7otkwA
之前想改個人物、場景、鏡頭啥的,動手之前可能會考慮考慮值不值得再等很長時間。
現在不用愁了,有了靈感就能快速出片。
對很多創作者來說,創意落地、試錯的時間成本都降低了,也不用因為漫長等待就砍掉很多一閃而過的想法。
那么問題來了,不降BF16精度,也不開掛頂級數據中心算力,RunningHub摳出來的時間,到底是從哪兒省出來的?
人人都能用,本地可部署
快,自然是用工程摳出來的,解法是很工整的三刀——
先看看哪里算得太多,再看看哪里算得太慢,最后看看幾張GPU之間有沒有時間浪費在“互相等”上。
第一刀,先從模型本身動手,讓H3少算一點。
視頻生成不是模型看完Prompt,啪一下就直接把最終畫面吐出來。
它需要一輪一輪地把畫面“想”出來。
把文字或者圖片變成視頻需要經過多輪計算,畫面才會逐漸從噪聲中成形,這個輪次叫生成步數。
原始H3推理默認50步,每一步背后都有一輪實打實的計算,步數越多,GPU自然就得干得越久。
RunningHub做的第一件事,就是引入自研的RH后訓練加速模型
簡單點說就是讓H3經過后訓練之后,學會用更少的步數把視頻做出來,還得在不丟畫質的前提下完成。
這一步的效果已經相當明顯。
同樣使用4張RTX 6000D生成5秒視頻,換成RH后訓練加速模型的9步測試方案之后,時間直接縮短到了43秒。
第一刀下去,已經提速了8倍。
順便說一句,RunningHub的推薦配置是默認4步;
遇到快速運動、大幅動作這類難任務可以切到8步,快還是穩,咱創作者自己來決定。
做到43秒,按理說已經挺猛了,但RunningHub顯然還嫌慢。
模型雖然少算了,可剩下這些必須完成的計算,總不能就這么放著吧。
RunningHub接著想解決的是,剩下這些必須完成的計算,還有沒有地方能繼續省時間?
于是第二刀開始往執行層里砍。
這次一口氣上了三個技術組合,SageAttention2、Cache-DiT和torch.compile
SageAttention2盯的是注意力計算
視頻模型每生成一段內容,都需要處理大量畫面元素之間的關系。
誰和誰相關、前后畫面怎么聯系、不同信息怎么共同影響最終結果,這些注意力計算本身就是推理過程中相當吃算力的一環。
SageAttention2要做的就是讓這塊核心計算執行得更高效。
Cache-DiT則開始盯著重復勞動
視頻生成前后多個計算步驟之間存在可以復用的信息,如果有些中間結果已經算過,后面的步驟就沒必要每次都從頭再來。
能緩存的緩存,能復用的復用,把重復工作減下來,時間自然還能繼續往下擠。
最后還有torch.compile,它會對計算過程進行編譯優化,讓GPU執行這些操作時更加順暢,減少一些原本零散的調度和執行開銷。
當RH后訓練加速模型和這些算子、緩存、編譯優化疊到一起,該跑快的跑快,該復用的復用,該捋順的捋順,剛才壓到43秒的生成過程又被繼續壓到了28.7秒。
但這還沒完,H3這種視頻模型真跑起來,往往不會只讓一張GPU單打獨斗。
多張卡一起干活,新的問題就又來了。
卡多,不等于一定快。這和多人一起干活其實挺像的。
八個人當然比一個人手多,可如果任務分配不合適,每個人剛干兩下就要停下來等別人遞東西,A等B,B等C,最后時間全耗在互相交接上。
多卡推理也是類似的道理。
GPU之間需要不斷交換數據,而在沒有NVLink高速互聯、主要依靠PCIe通信的環境里,卡間通信的成本尤其不能忽略。
RunningHub這次專門針對這種環境,把不同的多卡并行方式拉出來重新測了一遍,最后選中的組合是TP2+Ulysses4
TP負責從張量計算層面拆任務,Ulysses則進一步從序列維度做并行。
在8張RTX 6000D、PCIe連接且沒有NVLink的環境下,TP2+Ulysses4相比TP4+Ulysses2,速度快約12%,同時減少約14GiB顯存占用
所以從整體技術路徑來看,這套工程棧基本就是沿著推理鏈路一路摳時間:
RH后訓練加速模型先把需要完成的計算量壓下來;
SageAttention2、Cache-DiT和torch.compile繼續提高剩余計算的執行效率;
到了多卡層面,再用TP2+Ulysses4減少通信和資源上的浪費;
最后,RunningHub把這些方法全部整合進SGLang multimodal_gen推理引擎,由它把模型生成、多卡協同和各種加速組件真正組織到一起。
現在AI行業的各種性能數字已經卷得飛起,只要舍得堆頂級GPU、高速互聯和數據中心,把模型跑得飛快并不稀奇。
可真正想本地部署開源視頻模型的創作者、工作室和中小團隊要問了:
我手里的機器,能不能跑出這個速度?
RunningHub:必須能。
H3 Lightning特意繞開了“超能力解法”,針對的就是無NVLink的PCIe多卡環境,RTX 6000D也是公開可購買的專業GPU規格。
也就是說,RunningHub從一開始針對性優化的,就是一種更貼近工作室和企業團隊實際部署的多卡環境。
當然了,如果你的預算沒上限,用B300的卡配合這個方式,出片速度能直接提升至秒級。
從環境安裝、模型下載,到服務啟動和推理測試,H3 Lightning整個本地部署流程都公開了。
開發者也可以結合公開的社區加速LoRA,再配上前面提到的注意力優化、計算緩存和多卡并行,在自己的機器上重新跑一遍。
到底要幾張卡、怎么調參數、速度和畫質怎么取舍,都可以圍繞自己的業務適配。
當然了,有設備的團隊可以照著開源方案自己部署;
沒有多卡服務器、不想研究環境配置的創作者,直接在RunningHub上點開H3 Lightning也能用
頂級算力被壟斷,RunningHub選了創作者夠得著的那條路
當一個足夠強的開源模型出來之后,圍繞它其實會出現很多“二創”。
有人會拿開源底座繼續做后訓練,把優化后的能力跑在頂級數據中心集群上,再封裝成API提供給用戶。
用戶不需要關心背后的GPU和工程優化,按調用付費就能直接獲得結果,這當然是一種很成熟的商業路徑。
另一邊,也會有人選擇把優化繼續留在開源生態里
開發者自己擁有硬件、自己部署模型,圍繞自己的工作流繼續改,優化方法又能被下一批開發者拿去復現和迭代。
RunningHub這次明顯更偏向后者。
而且,這已經不是它第一次圍著H3這么干了。
H3剛開源的時候,RunningHub首先做的是接入
模型出來之后,平臺第一時間把它接進來,讓創作者不用先研究一大堆部署問題,就可以上手嘗試新模型。
隨后,它又參與生態共建,把全套ComfyUI節點開源。
這一下,開發者能玩的更多了。
有人拿H3做電商內容,有人拿去做短劇、漫劇,有人研究聲音克隆、動作克隆和音頻驅動,還有人繼續把自己的玩法封裝成新的工作流。
比如,創作者@魅力創意直接盯上了電商視頻。
TA發布的MiniMax H3·電商多參生視頻工作流,只需要把商品、模特、場景一股腦塞進去,再簡單說說賣點——
H3就能自己琢磨人物該在哪兒、商品怎么露出、場景怎么搭,最后直接給你一條完整電商廣告。
還有創作者@艾橘溪整的音頻驅動數字人說話唱歌工作流。
上傳一張人物圖片,再扔進去一段音頻,原本靜止的人物就能秒變數字人開口營業。
不管是說話還是唱歌,口型和節奏都能同步對上。
還有今年超火的漫劇,創作者@qwlulnpi也搬出了新創意。
把分鏡圖、腳本、音頻一次性丟進去就能拿到有畫面有聲音的完整成片。
多少有點“素材備齊,一把梭哈”的流水線味兒了。
這還只是RunningHub上冒出來的一小撮玩法。
自打H3上線以來,RunningHub平臺上已經有上千名創作者,圍繞它開源了近萬條創意工作流。
其實這也是開源模型的樂趣,一個人解決一點問題,最后整個生態能用的東西就越來越多。
而H3 Lightning相當于RunningHub再進一步,開始把自己積累的工程能力反過來貢獻給H3,直接解決推理效率的問題。
如果只看RunningHub,一個AIGC創作平臺突然跑去研究后訓練、算子優化和多卡并行,多少有點跨界。
但把它放回母公司海馬云過去十多年的技術演進里,這事兒其實順理成章。
海馬云2014年成立,過去十多年長期和GPU、高性能內容打交道。
那個時候,行業面對的問題還不是“AI大模型怎么推理”。
當時的核心矛盾是游戲、圖形、高性能數字內容體量越來越大,如何讓這些負載穩定、高速地運行起來。
GPU容器調度、圖形虛擬化、實時流媒體、大規模云渲染,海馬云的整套能力體系都是圍繞這個目標打磨的。
時至今日,海馬云已經在國內建設60余個邊緣節點,支撐超過2000萬月活用戶的智算服務。
到了生成式AI時代,需要被高效調度的計算對象發生了變化。
除了游戲、圖形和高性能數字內容,現在還加入了大模型,以及模型驅動的內容生成。
于是海馬云面對的命題也隨之從「高性能內容怎么跑」,進一步轉向了「AI能力如何調用,又如何高效落地」。
計算對象從云渲染到AI推理,但這也恰好讓海馬云這家原生AI公司十余年的技術積累有了更大的發揮場景。
所以RunningHub并不算“跨界”做模型加速。
RunningHub H3 Lightning,是海馬云「GPU工程能力」在AI時代的一個新落點,補齊的也是開源模型從權重到生產力之間缺失的環節。
過去一年,開源模型越來越多,真正稀缺的是:
誰能在模型開源之后,最快把它接進真實環境、優化到生產可用,再把這些能力持續回饋給社區。
模型開源,RunningHub平臺完成接入,創作者「能直接用」了;
開放ComfyUI節點與工作流,創作者「能玩的花樣」多了;
而H3 Lightning推理優化,則是在模型跑通之后,繼續攻克速度、成本與硬件門檻,把單次試玩的內容生成,升級為可穩定復用的批量生產力。
RunningHub就是這樣一個生態反哺者
咱普通創作者也算是跟著吃上細糠了~
GitHub倉庫:https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/
相關文章
精彩推送
唐人神:8月生豬銷售49.23萬頭,同比增長21.22%;銷售收入4.10億元,同比下降39.92%_每日看點
南財智訊9月10日電,唐人神公告,公司2026年8月生豬銷量49 23萬頭,同
英矽智能公告,公司AI驅動候選創新藥物Rentosertib已在針對特發性肺纖維化的III期臨床試驗GENESIS-IPF-3中完成首例患者入組并給藥|看熱訊
英矽智能公告,公司AI驅動候選創新藥物Rentosertib已在針對特發性肺纖
當前熱門:2026凱度BrandZ最具價值中國品牌100強出爐!6家保險機構上榜 中國平安位列第9
2026凱度BrandZ最具價值中國品牌100強出爐!6家保險機構上榜中國平安位列第9
