Articles

[EN] MELON:无需相机位姿从图像重建3D物体

Google Research团队提出MELON(模等价潜在优化NeRF)技术,能在完全没有相机位姿先验信息的情况下,仅用4-6张2D图像就重建出3D物体,通过轻量CNN编码器与模损失函数解决了长期存在的位姿与3D结构间的“先有鸡还是先有蛋”难题。

Google AI Blog 03:29 AI 辅助 计算机视觉 3D重建

[EN]Google提出ScreenAI:统一理解UI与信息图的视觉语言模型

Google研究人员推出ScreenAI,一种基于PaLI架构与pix2struct灵活分片策略的视觉语言模型,仅5B参数即可在UI与信息图理解任务上达到业界领先水平。模型通过自监督预训练与人工标注微调,结合大规模屏幕标注数据,能完成UI元素识别、导航、问答等任务,并开源了三个新数据集。

Google AI Blog 03:29 AI 辅助 人工智能 计算机视觉 自然语言处理