
Stepfun 团队正式开源了图像编辑模型 Step1X-Edit。这款模型能够让用户通过自然语言对图片进行编辑。例如,把图片中黑夜的场景变成白天,添加文字,为人物添加一副眼镜等。效果媲美 GPT-4o 和 Gemini 2。
Step1X-Edit 的技术核心在于多模态大模型的集成应用。模型能够同时理解并处理图像和自然语言编辑指令,通过抽取潜在特征嵌入,并与扩散式图像解码器协同工作,实现对目标图像的灵活生成。这一流程的关键在于对用户多样化编辑需求的精准把握与还原,确保生成结果既符合指令意图,又具备较高的视觉一致性。为此,团队自研了一套高质量数据生成管线,有效支撑了模型训练和性能提升。
从实际测试来看,Step1X-Edit 对硬件资源有一定要求。以 512x512 分辨率为例,单卡推理需约 42.5GB 显存,而在更高分辨率下对显存的需求也相应提升。团队建议使用 80GB 显存的 GPU,以获得更优生成质量。
评论(0)