自然语言图像编辑工具 Step1X Edit 介绍-创艺提示符

Stepfun 团队正式开源了图像编辑模型 Step1X-Edit。这款模型能够让用户通过自然语言对图片进行编辑。例如，把图片中黑夜的场景变成白天，添加文字，为人物添加一副眼镜等。效果媲美 GPT-4o 和 Gemini 2。

Step1X-Edit 的技术核心在于多模态大模型的集成应用。模型能够同时理解并处理图像和自然语言编辑指令，通过抽取潜在特征嵌入，并与扩散式图像解码器协同工作，实现对目标图像的灵活生成。这一流程的关键在于对用户多样化编辑需求的精准把握与还原，确保生成结果既符合指令意图，又具备较高的视觉一致性。为此，团队自研了一套高质量数据生成管线，有效支撑了模型训练和性能提升。

从实际测试来看，Step1X-Edit 对硬件资源有一定要求。以 512x512 分辨率为例，单卡推理需约 42.5GB 显存，而在更高分辨率下对显存的需求也相应提升。团队建议使用 80GB 显存的 GPU，以获得更优生成质量。