Turbo 어댑터
bf16 LoRA
브라우저에서 무료로 쓰는 적은 스텝 오디오·비디오 생성
MiniMax H3 Turbo LoRA는 H3의 영상과 스테레오 오디오 동시 생성을 유지하면서 샘플링 스텝을 줄이는 어댑터입니다. 33B 기반 모델을 설치하지 않고 텍스트, 첫 프레임, 첫·마지막 프레임을 시험할 수 있습니다.
샘플링 스텝은 최대 약 5배 감소하며 실제 시간은 대기열·캔버스·하드웨어에 따라 달라집니다.
MiniMaxAI가 운영하는 공개 Space입니다. 프롬프트, 첫·마지막 프레임, 캔버스, 길이, 스텝, Seed, 프롬프트 확장과 LoRA를 설정할 수 있습니다.
Hugging Face ZeroGPU에서 실행되므로 대기열, 일일 한도, 콜드 스타트, 일시 중단이 있고 추가 용량에 로그인을 요구할 수 있습니다.
별도 기반 모델이 아니라 MiniMax H3용 저랭크 어댑터입니다. 적은 스텝으로 결과를 만들면서 영상과 음성의 동시 생성을 유지합니다.
약 744MB LoRA만으로는 생성할 수 없습니다. 로컬에서는 큰 H3 기반 모델, VAE와 텍스트 인코더가 필요하며 무료 Space가 이를 원격 GPU에 묶어 제공합니다.
bf16 LoRA
로컬에도 필요
현재 구현
프레임 그리드 정렬
4스텝은 빠른 지점, 6–8스텝은 디테일과 움직임을 개선합니다.
별도 더빙이 아니라 동기 스테레오 사운드를 함께 만듭니다.
텍스트, 첫 이미지, 첫·마지막 이미지 입력을 지원합니다.
Apache-2.0 어댑터와 ComfyUI 노드가 있지만 기반 모델 부하는 큽니다.
현재 모델 카드 기준의 로컬 ComfyUI 권장값이며 공개 Space UI는 바뀔 수 있습니다.
| 설정 | 권장 | 이유 |
|---|---|---|
| Checkpoint | v4 step-600 EMA | 정적 장면, 작은 움직임과 세부 표현에 적합. |
| Sampling steps | 6–8 | 4보다 깔끔하며 8 이상은 과도하게 선명해질 수 있음. |
| LoRA strength | 1.0 | 1.0에 맞춰 조정됨. |
| Scheduler | simple | 공개 워크플로의 기준. |
| 빠른 초안 | 4 steps | 큰 동작에서 잔상이 생길 수 있음. |
Gradio Space는 호출할 수 있지만 가용성 보장이 없는 공개 데모입니다. 프로덕션에는 유료 공급자가 적합합니다.
호출 전 view_api()로 실시간 schema를 확인하세요. UI 업데이트로 endpoint와 인수가 바뀔 수 있습니다.
import { Client } from "@gradio/client";
const client = await Client.connect(
"MiniMaxAI/MiniMax-H3-Turbo-Lora"
);
// Read the live schema before calling the public Space.
console.log(await client.view_api());WaveSpeed는 3–15초, 커스텀 LoRA와 스테레오 오디오를 지원하는 H3 text-to-video LoRA REST API를 제공합니다.
2026년 9월 4일 기준. 결제 전 재확인하세요.
Turbo는 샘플링을 줄이지만 대형 오디오·비디오 모델의 운영 제약은 남습니다.
익명 한도가 작고 대기가 길거나 실패할 수 있습니다.
작은 LoRA와 달리 기반 모델, 인코더와 VAE가 저장공간과 메모리를 차지합니다.
4스텝 잔상에는 먼저 스텝을 늘리고 장면을 단순화하세요.
endpoint, 입력, 가용성, 인증이 바뀔 수 있어 핵심 백엔드로 부적합합니다.
아닙니다. H3 기반 모델에 적용해 필요한 스텝을 줄이는 LoRA입니다.
ZeroGPU Space는 MiniMax API 키 없이 가능하지만 할당량, 대기열, 로그인 요구가 있습니다.
예. 첫 프레임과 선택적 마지막 프레임을 사용할 수 있습니다.
예. 영상과 동기 스테레오 오디오를 함께 생성하며 품질은 계속 개선 중입니다.
v4, 6스텝, strength 1.0, simple scheduler로 시작하고 품질 우선이면 8스텝을 사용하세요.
호출은 가능하지만 보장이 없습니다. 유료 API 또는 자체 호스팅이 적합합니다.