MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
Paper โข 2505.13031 โข Published โข 4
How to use EasonXiao-888/MindOmni with Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained("EasonXiao-888/MindOmni", dtype=torch.bfloat16, device_map="cuda")
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]This repository contains the MindOmni model described in the paper MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO.