[EN] MELON:无需初始位姿即可从图像中重建3D物体
Google Research团队提出MELON技术,能在不依赖相机初始位姿、预训练或复杂训练方案的情况下,仅凭4至6张未标注位姿的2D图像,高精度重建物体3D模型。该技术通过轻量级CNN编码器动态回归相机位姿,并引入模损失(modulo loss)处理物体伪对称问题,为3D重建领域提供了一种简洁且易于集成的解决方案。
Google Research团队提出MELON技术,能在不依赖相机初始位姿、预训练或复杂训练方案的情况下,仅凭4至6张未标注位姿的2D图像,高精度重建物体3D模型。该技术通过轻量级CNN编码器动态回归相机位姿,并引入模损失(modulo loss)处理物体伪对称问题,为3D重建领域提供了一种简洁且易于集成的解决方案。
Google Research团队提出MELON方法,能够在没有相机姿态初始估计的情况下,仅凭4-6张2D图像即可重建3D物体,通过轻量级CNN编码器和模损失函数解决了姿态推断中的伪对称问题。
Google Research 推出了 ScreenAI,一个仅 5B 参数的视觉语言模型,专门用于理解用户界面和信息图表。该模型基于 PaLI 架构与 pix2struct 的灵活分块策略,在多个基准测试中取得领先结果,并配套发布了三个新数据集以评估布局理解与问答能力。
Google Research团队提出MELON(模等价潜在优化NeRF)技术,能在完全没有相机位姿先验信息的情况下,仅用4-6张2D图像就重建出3D物体,通过轻量CNN编码器与模损失函数解决了长期存在的位姿与3D结构间的“先有鸡还是先有蛋”难题。
Google研究人员推出ScreenAI,一种基于PaLI架构与pix2struct灵活分片策略的视觉语言模型,仅5B参数即可在UI与信息图理解任务上达到业界领先水平。模型通过自监督预训练与人工标注微调,结合大规模屏幕标注数据,能完成UI元素识别、导航、问答等任务,并开源了三个新数据集。
Google Research 提出 MELON 技术,无需初始相机姿态估计、复杂训练或预训练,即可从少量未标定图像中同时推断相机姿态并重建 3D 对象,在 NeRF 框架下实现高精度。
谷歌研究团队推出ScreenAI,一个仅5B参数的视觉语言模型,基于PaLI架构和pix2struct的灵活分块策略,在UI元素识别、图表问答等任务上达到最优性能,并开源了Screen Annotation、ScreenQA Short和Complex ScreenQA三个新数据集。
Google Research发布ScreenAI,一种基于PaLI架构并融合pix2struct灵活分块策略的视觉语言模型。该模型在仅有5B参数的情况下,在WebSRC、MoTIF等UI及信息图任务上达到最优水平,并在Chart QA、DocVQA等基准测试中超越同规模模型。研究团队还开源了Screen Annotation、ScreenQA Short和Complex ScreenQA三个新数据集。
Google Research 团队提出 MELON 技术,能在无相机初始姿态、无预训练数据的条件下,仅凭4-6张图片即可高精度重建物体的3D NeRF模型,解决了姿态未知下的“先有鸡还是先有蛋”难题。