4月7日,京东探索研究院宣布,正式对外开源其最新研发的图像编辑模型“JoyAI-Image-Edit”。
该模型的核心突破在于对图像三维空间结构的深度理解。与传统图像处理技术相比,它能够有效避免因空间逻辑混乱导致的物体变形、透视错误或遮挡关系不合理等问题,在空间理解与编辑方面已达到国际先进水平。
据了解,以往的技术在处理图像时,往往局限于二维平面操作,难以准确把握真实世界的空间规律。而新模型将空间智能融入其底层架构,能够精准解析图像蕴含的三维结构。因此,在对图像中的物体进行移动、视角变换等操作时,能够保持场景原有的几何规律,使光影、遮挡等效果呈现得更为自然,主体与场景结构均保持协调一致。
该模型具备三大核心空间编辑功能:视角变换、空间漫游以及物体空间关系操控。用户可通过自然语言指令调整相机角度以生成新视角图像,亦可连续移动视角,生成一系列连贯的多视角画面。
此外,该模型还兼容多达15类通用图像编辑能力,包括物体替换与删除、风格迁移、长文本渲染等任务,均可高效完成。
在应用层面,该技术预计将广泛应用于电商内容制作、创意设计、3D模型重建以及机器人视觉感知等多个领域。特别是在机器人智能领域,该模型有望为机器理解物理环境提供重要的视觉基础能力。
近期,京东在技术研发领域持续投入,不仅开源了多个基础模型,其相关技术产品的调用量也显著攀升。公司还计划建设大规模的数据采集中心,以进一步推动前沿技术与实体产业的结合。
