画面里本不存在的物体被讲得煞有介事,颜色、数量、空间关系凭空捏造 —— 视觉大模型这类 “幻觉” 问题,一直是它难以从演示走进真实应用的一道坎。近日,十方融海联合广东工业大学、南洋理工大学完成的一项研究被国际顶级学术会议 EMNLP2026收录,论文《YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models》提出的,正是一种更省算力的抑制幻觉方法。其核心方案 YARD(Y 型架构寄存器解码),通过一条 “退化分支” 与完整信息互相对照,让模型说出来的话更贴近它真正看到的画面。

EMNLP(Conference on Empirical Methods in Natural Language Processing,自然语言处理经验方法会议)是自然语言处理领域公认的顶级国际学术会议,每年收录的研究基本代表了这一方向的最前沿。YARD 此番入选,意义不止于一篇文章:它并非孤立的算法创新,而是高校与企业各带所长、围绕同一个产业级难题协作出来的务实样本,把视觉大模型可靠性这一难题向前推进了一步。
视觉大模型的 “幻觉”,本质上是模型说出的内容与画面真实信息之间的错位。当模型开始被用于内容生产、辅助决策、工业质检、医疗读片等场景,这种错位的代价就不再是 “答错一道题”,而是直接关系到结果能否被信任。可靠性因此成为多模态模型能否从 “演示” 走向 “日常使用” 的关键变量 —— 这也是这项研究把目光对准幻觉的原因。
YARD 的思路,可以理解成给模型配了一面 “校对镜”。它不改变模型本身,也不额外训练,而是在推理时另设一条 “退化分支”:这条分支保留了画面的全局语义,却主动舍弃了细部的局部信息,让模型只能看到一张 “打了折扣” 的画面。完整分支与退化分支各自给出答案,两相对照,差异之处往往就是模型凭空 “脑补” 出来的地方 —— 把这些偏差压下去,幻觉自然就少了。
这套方法最直观的效果,是让模型 “看到的” 和 “说出的” 重新对齐。在多个国际通用评测基准上,YARD 的幻觉率明显下降、判别准确率同步提升,而且方法不依赖特定模型,可迁移到多种主流视觉大模型;整个过程无需额外训练,也不用付出成倍的算力代价,以较小的开销就换来了更优的抑制效果。落到内容生产、辅助决策等真实场景,这意味着一线人员要做的纠错更少、系统的可用性更高 —— 这些变化不必对照评测表格,使用者很快就能感受到。
这项研究由广东工业大学、南洋理工大学与十方融海联合完成,分工清晰:高校团队负责核心方法与理论推演,十方融海则把长期在多模态产品交互中积累的用户意图感知、视觉理解等真实痛点带了进来,深度参与研究方案的设计与实验验证,让方法从一开始就对准产业里真正卡住的问题。
值得一提的是,十方融海创始人黄冠、陈劢、雷浪声,以及旗下 AI 交互平台市场研发负责人杜君,都出现在作者名单上 —— 三位创始人与业务线负责人集体署名,在产学研合作论文中并不常见,也从侧面说明,十方融海对底层技术研究的投入是持续而认真的。
作为 AI 原生生态企业,十方融海正围绕 “引擎 — 开源 — 智能体 — 终端” 构建 AI 原生生态。而比概念更值得关注的是,这一路径已经开始在具体场景中落地:Openbuddy、Tens AI 等自研模型持续对外释放价值,其开源 AI 交互平台相关生态终端设备接入量已超200万台,底层能力正通过硬件与交互场景进入更广泛的实体链条。目前,十方融海在大模型、多模态交互等方向已积累30余项专利、200余件技术型知识产权。

对十方融海而言,这项研究的意义不止于一篇论文。十方融海创始人兼 CEO 陈劢表示:“我们更在意的,是视觉大模型能否真正走进日常使用 —— 从会‘看图说话’的演示,变成工业、医疗、内容生产里可以托付的伙伴。模型越不可靠,落地就越打折扣;用底层技术的确定性去对冲模型的不确定性,是我们一直坚持的方向。” 在她看来,随着视觉大模型加速进入真实场景,围绕幻觉这类可靠性问题的攻关,将越来越成为下一阶段 AI 落地的分水岭 —— 而这,也正是企业“让每个人,因 AI 而不同”这一愿景得以落地的前提。