Google Research

[EN] MELON:无需初始位姿即可从图像中重建3D物体

Google Research团队提出MELON技术,能在不依赖相机初始位姿、预训练或复杂训练方案的情况下,仅凭4至6张未标注位姿的2D图像,高精度重建物体3D模型。该技术通过轻量级CNN编码器动态回归相机位姿,并引入模损失(modulo loss)处理物体伪对称问题,为3D重建领域提供了一种简洁且易于集成的解决方案。

Google AI Blog 23:13 AI 辅助 计算机视觉 3D重建

[EN]Google提出ScreenAI:统一理解UI与信息图的视觉语言模型

Google研究人员推出ScreenAI,一种基于PaLI架构与pix2struct灵活分片策略的视觉语言模型,仅5B参数即可在UI与信息图理解任务上达到业界领先水平。模型通过自监督预训练与人工标注微调,结合大规模屏幕标注数据,能完成UI元素识别、导航、问答等任务,并开源了三个新数据集。

Google AI Blog 03:29 AI 辅助 人工智能 计算机视觉 自然语言处理