Turbo 适配器
bf16 LoRA 权重
下方嵌入由 MiniMaxAI 托管的公开 Space。目前可设置提示词、可选首帧与尾帧、画布、时长、步数、Seed、提示词扩写和 LoRA。
生成运行在 Hugging Face ZeroGPU。排队、每日用户额度、冷启动和临时离线都属正常情况;Space 也可能要求登录 Hugging Face 以获得更多额度。
它是 MiniMax H3 的低秩适配器,不是另一套基础模型。适配器改变去噪过程,让 H3 用更少采样步得到可用结果,同时保留画面与声音联合生成。
本地运行时,约 744 MB 的 LoRA 仍依赖体积大得多的 MiniMax H3 基础模型、VAE 和文本编码器。免费 Space 只是在远程 GPU 上封装了整套环境;单独下载 LoRA 不能生成视频。
bf16 LoRA 权重
本地仍然需要
当前实现
按帧网格对齐
4 步是快速设计点;6–8 步通常以更多计算换取更干净的细节与运动。
H3 同时对视觉和音频流去噪,输出同步立体声,而不是生成后再单独配音。
公开工作流支持纯文字、首帧图片,以及首帧加尾帧的引导式图生视频。
适配器权重采用 Apache-2.0,并有 ComfyUI 节点;但硬件需求仍主要由大型基础模型决定。
以下建议来自当前 Turbo LoRA 模型卡,更适合本地 ComfyUI;公开 Space 展示的控制项可能随时调整。
| 参数 | 建议 | 原因 |
|---|---|---|
| Checkpoint | v4 step-600 EMA | 综合表现更强,适合静态、小幅运动和微小细节。 |
| 采样步数 | 6–8 | 通常比 4 步更干净;超过 8 步收益很小,还可能过度锐化。 |
| LoRA 强度 | 1.0 | 模型围绕 1.0 调整,只在修复具体伪影时改变。 |
| Scheduler | simple | 公开工作流和采样器按 simple 调度器设计。 |
| 快速草稿 | 4 步 | 适合快速迭代,但高速或大幅运动可能出现拖影。 |
嵌入的 Gradio Space 可以作为 API 调用,但它仍是没有可用性保证的公开演示。生产流量更适合正式付费服务。
提交任务前先用 view_api() 读取实时 schema。Space 更新界面后,端点和通用参数名可能改变。
import { Client } from "@gradio/client";
const client = await Client.connect(
"MiniMaxAI/MiniMax-H3-Turbo-Lora"
);
// Read the live schema before calling the public Space.
console.log(await client.view_api());WaveSpeed 当前提供 MiniMax H3 文生视频 LoRA REST 端点,支持 3–15 秒、自定义 LoRA 和原生立体声音频。
价格核验于 2026 年 9 月 4 日;付费前请再次确认服务商页面。
Turbo 减少的是采样计算,并不会消除大型音视频模型的运行限制。
匿名额度很少,排队可能很长,无法保证每次都能成功。
LoRA 文件小不等于本地 H3 轻量;基础模型、编码器和 VAE 才是存储与内存的主要开销。
4 步可能让快速主体产生拖影。先提高步数并简化场景,再调整更多参数。
端点、参数、可用性和认证都可能变化,不要把关键后端建立在公共免费额度上。
不是。它是加载到 MiniMax H3 基础模型上的 LoRA 适配器,用于减少有效采样步数。
下方公开 Space 使用 Hugging Face ZeroGPU,无需 MiniMax API Key;但会受到用户额度、排队和登录提示限制。
支持。当前工作流除了提示词,还可以选择首帧和尾帧图片。
会。MiniMax H3 会同时生成画面与同步立体声音频,但模型卡也说明音频仍在持续改进。
当前 v4 checkpoint 建议从 6 步、强度 1.0 和 simple 调度器开始,重视质量时可用 8 步。
技术上可以调用,但它有公共额度且没有服务保证。生产业务应使用付费服务或自行部署。