Instructions to use MiniMaxAI/MiniMax-H3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use MiniMaxAI/MiniMax-H3 with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("MiniMaxAI/MiniMax-H3", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
H3-Context-IR未来会开源吗?
rt
H3-Context-IR 由于是一系列模型的组合,技术上无法开源。我们后续会尝试用新的技术架构解决
那能不能把workflow 给端出来?
我们之后讲一下思路,相信社区的力量
期待开放思路报告
我们之后讲一下思路,相信社区的力量
完全可以理解,看得出来生成那一套结构化提示词需要很复杂的多模态理解以及视觉规划能力。能把H3-Context-IR 的输出选为人类能理解的自然语言而非latent embedding,想要嵌入工作流就只是时间功夫了,大不了能工智人嘛。
我看现在comfy官方没有放出H3-Regenerate-2K的工作流,看技术实现是不是应该用ref2va的模型来参考原视频生成,只是目前还没封装成节点对吧?
我看现在comfy官方没有放出H3-Regenerate-2K的工作流,看技术实现是不是应该用ref2va的模型来参考原视频生成,只是目前还没封装成节点对吧?
是的 H3-Regenerate-2K之后稳定了会开源
期待开放思路报告
试了一下comfyui官方的工作流,感觉效果还行(除了清晰度问题)。期待一下后期的2K工作流开源。
我看现在comfy官方没有放出H3-Regenerate-2K的工作流,看技术实现是不是应该用ref2va的模型来参考原视频生成,只是目前还没封装成节点对吧?
是的 H3-Regenerate-2K之后稳定了会开源
目前我按照介绍的思路,参考comfy的ref2va工作流,用一张高清首尾帧图+之前生成的视频+之前视频的prompt,将最终生成的视频分辨率拉到2k分辨率,5秒的视频是可以放大生成的,还原度也比较OK。但是15秒画面就直接崩掉了,我觉得可能是因为模型蒸馏的原因,导致15秒高分辨率崩了。看到的介绍是h3-regenerate-2k的放大也是用base模型加上prompt重新采样的逻辑。