视觉语言模型

[EN]Google提出ScreenAI:统一理解UI与信息图的视觉语言模型

Google研究人员推出ScreenAI,一种基于PaLI架构与pix2struct灵活分片策略的视觉语言模型,仅5B参数即可在UI与信息图理解任务上达到业界领先水平。模型通过自监督预训练与人工标注微调,结合大规模屏幕标注数据,能完成UI元素识别、导航、问答等任务,并开源了三个新数据集。

Google AI Blog 03:29 AI 辅助 人工智能 计算机视觉 自然语言处理

[EN] ScreenAI:面向UI与信息图的视觉语言模型,5B参数达SOTA

Google Research发布ScreenAI,一种基于PaLI架构并融合pix2struct灵活分块策略的视觉语言模型。该模型在仅有5B参数的情况下,在WebSRC、MoTIF等UI及信息图任务上达到最优水平,并在Chart QA、DocVQA等基准测试中超越同规模模型。研究团队还开源了Screen Annotation、ScreenQA Short和Complex ScreenQA三个新数据集。

Google AI Blog 01:52 AI 辅助 人工智能 计算机视觉 自然语言处理

[EN] Google推出ScreenAI:端到端视觉语言模型,统一理解UI界面与信息图表

Google Research发布ScreenAI,一种基于PaLI架构并融合pix2struct灵活分块策略的5B参数视觉语言模型,专为理解用户界面与信息图表设计。通过自监督预训练和屏幕标注任务,ScreenAI在WebSRC、MoTIF、ChartQA等多项基准测试中达到或超越同规模模型的最优性能,同时发布了三个新数据集。

Google AI Blog 06:39 AI 辅助 人工智能 多模态模型 人机交互