谷歌发布可读屏AI模型ScreenAI：可理解用户界面和信息图表

**划重点:**
1. 🌐 **ScreenAI引领AI界新趋势:** 谷歌研究推出ScreenAI，该AI模型能理解用户界面和信息图表，刷新各项任务的性能指标，包括根据信息图表回答问题、总结内容以及导航用户界面。
2. 🧠 **技术创新:** ScreenAI采用新颖的截图文本表示方法，通过识别UI元素的类型和位置，利用Google LLM PaLM2-S生成合成训练数据，使模型能够回答关于屏幕信息、屏幕导航和总结屏幕内容的问题。
3. 🚀 **未来展望与挑战:** 尽管ScreenAI在改善对数字内容理解方面取得了一定进展，但模型尚不能执行生成的操作。研究人员表示，尽管该专用模型在其类别中表现最佳，但在与更大型模型（如GPT-4和Gemini）的某些任务上仍需进一步研究，以推动其实际应用的发展。

站长之家（ChinaZ.com）3月5日消息:谷歌研究最新发布的ScreenAI标志着语言和语音控制计算机界面的又一重要进展。这一AI模型不仅能理解用户界面和信息图表，而且在回答基于信息图表的问题、总结内容以及导航用户界面等多项任务上，创下了新的性能标杆。

ScreenAI的核心创新在于对截图的文本表示方法。该模型能够识别UI元素的类型和位置，这一方法使用了Google LLM PaLM2-S生成的合成训练数据，使其能够回答关于屏幕信息、屏幕导航和总结屏幕内容的问题。

为实现这一创新，ScreenAI将谷歌先前的技术进展，如PaLI架构和Pix2Struct的灵活修补机制，相结合。后者根据宽高比将图形分割为可变网格。ScreenAI通过图像编码器和多模态编码器处理图像和文本输入，然后使用自回归解码器生成文本输出。

研究人员进行的实验证明，模型性能随着模型大小的增加而提高。这表明通过扩大模型规模，可以进一步提升性能。与类似规模的模型相比，ScreenAI在各项基准测试中表现最佳，通常超过更大型模型。此外，使用光学字符识别（OCR）从截图中提取文本内容对模型性能有轻微积极影响。

然而，尽管ScreenAI在数字内容理解方面取得了一定里程碑，但模型尚不能执行生成的操作。研究人员指出，尽管目前有一些在智能手机上运行的语言模型，但缺乏更强大的多模态模型，这些模型可以结合文本、图像、音频和视频。他们预测，随着像ScreenAI这样的模型的发展，仅使用自然语言对智能手机和用户界面进行自动化处理将在不久的将来变得更加先进。

研究人员强调，虽然他们的专用模型在其类别中是最佳的，但在某些任务上仍需要进一步研究，以缩小与更大型模型（如GPT-4和Gemini）的差距。为鼓励更多的发展，谷歌研究计划发布ScreenAI的评估数据集，其中ScreenQA已经提供了包含36，000张截图的86，000个问答对;更复杂的变体和包含截图及其文本描述的集合将会推出。

格创东智AI EES免费授权100个名额，设备管理从“看报警”到“懂设备”？

2026-07-162.0万阅读

首页

IT业界

热点视频

站长资讯

好物榜

更多分类

更多主题

谷歌发布可读屏AI模型ScreenAI：可理解用户界面和信息图表

推荐关键词

24小时热搜

大家正在看

价格战一触即发！奥特曼放话OpenAI降价75%：被DeepSeek等中国AI逼的

山石网科惊艳亮相ISC.AI 2026，双A战略成果全景呈现

绚星完成AI原生研发体系重构，迈入AI Native企业新阶段

UALink联盟Kurtis：开放Scale-Up互连加速构建可部署AI超节点

dynabook邀您共聚西部电博会，共启AI产业新图景

像真人聊天！OpenAI发布GPT-Live：AI可同步听与说

从UMX到Scale-Up光互连阿里云勾勒Agentic AI基础设施新趋势

销售易AI原生CRM赋能荆楚，共绘“五谷丰登”产业新图景丨2026腾讯云武汉峰会

即构ZIM社群功能：构建Discord式实时互动社区

格创东智AI EES免费授权100个名额，设备管理从“看报警”到“懂设备”？

AI日报：谷歌推新图片模型Nano Banana 2 Lite；Claude Sonnet 5 发布；OpenClaw 正式推出 iOS 与 Android 移动版应用

ChinaJoy2026丨TCL华星邀您共赴AI视界电竞盛宴

AI 黑科技拉满！dynabook Portégé X30L-P 企业级商务笔记本详解

OpenAI计划推出旗下首款硬件产品：移动式智能音箱定位为AI陪伴助手

DeepSeek V4的正式版本计划于7月中旬上线

7月上线！DeepSeek V4正式版官宣：将引入峰谷定价机制

AI日报：混元发布HyOCR-1.5；PixVerse完成4.39亿美元融资；商汤开源 SenseNova-Vision-7B-MoT

与“Rix”相约，与“AI”同游｜RixEngine与RixDesk确认参展2026 ChinaJoy

华为耳机联动豆包功能全量上线：支持FreeClip 2、FreeBuds Pro 5

DeiNai亮相LEAP East 2026：连接中东与亚太，共探AI驱动的全球创作者营销未来

首页

IT业界

热点视频

站长资讯

好物榜

更多分类

更多主题

谷歌发布可读屏AI模型ScreenAI：可理解用户界面和信息图表

推荐关键词

24小时热搜

大家正在看

价格战一触即发！奥特曼放话OpenAI降价75%：被DeepSeek等中国AI逼的

山石网科惊艳亮相ISC.AI 2026，双A战略成果全景呈现

绚星完成AI原生研发体系重构，迈入AI Native企业新阶段

UALink联盟Kurtis：开放Scale-Up互连加速构建可部署AI超节点

dynabook邀您共聚西部电博会，共启AI产业新图景

像真人聊天！OpenAI发布GPT-Live：AI可同步听与说

从UMX到Scale-Up光互连 阿里云勾勒Agentic AI基础设施新趋势

销售易AI原生CRM赋能荆楚，共绘“五谷丰登”产业新图景丨2026腾讯云武汉峰会

即构ZIM社群功能：构建Discord式实时互动社区

格创东智AI EES免费授权100个名额，设备管理从“看报警”到“懂设备”？

AI日报：谷歌推新图片模型Nano Banana 2 Lite；Claude Sonnet 5 发布；OpenClaw 正式推出 iOS 与 Android 移动版应用

ChinaJoy2026丨TCL华星邀您共赴AI视界电竞盛宴

AI 黑科技拉满！dynabook Portégé X30L-P 企业级商务笔记本详解

OpenAI计划推出旗下首款硬件产品：移动式智能音箱 定位为AI陪伴助手

DeepSeek V4的正式版本计划于7月中旬上线

7月上线！DeepSeek V4正式版官宣：将引入峰谷定价机制

AI日报：混元发布HyOCR-1.5；PixVerse完成4.39亿美元融资；商汤开源 SenseNova-Vision-7B-MoT

与“Rix”相约，与“AI”同游｜RixEngine与RixDesk确认参展2026 ChinaJoy

华为耳机联动豆包功能全量上线：支持FreeClip 2、FreeBuds Pro 5

DeiNai亮相LEAP East 2026：连接中东与亚太，共探AI驱动的全球创作者营销未来

从UMX到Scale-Up光互连阿里云勾勒Agentic AI基础设施新趋势

OpenAI计划推出旗下首款硬件产品：移动式智能音箱定位为AI陪伴助手