首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >每日学术速递9.23

每日学术速递9.23

作者头像
AiCharm
修改2023-09-27 12:42:55
修改2023-09-27 12:42:55
3960
举报
文章被收录于专栏:AiCharmAiCharm

Subjects: cs.CV

1.360∘ Reconstruction From a Single Image Using Space Carved Outpainting(SIGGRAPH Asia 2023)

标题:使用空间雕刻外画从单个图像重建 360 ∘

作者:Nuri Ryu, Minsu Gong, Geonung Kim, Joo-Haeng Lee, Sunghyun Cho

文章链接:https://arxiv.org/abs/2309.10279

项目代码:http://cg.postech.ac.kr/research/POP3D/

摘要:

我们介绍 POP3D,这是一种新颖的框架,可以从单个图像创建完整的 360∘ 视图 3D 模型。POP3D解决了限制单视图重建的两个突出问题。首先,POP3D 为任意类别提供了实质性的通用性,这是以前的方法难以实现的特征。其次,POP3D进一步提高了重建保真度和自然度,这是并行作品所缺乏的一个关键方面。我们的方法结合了四个主要组件的优势:(1)单目深度和法线预测器,用于预测关键的几何线索,(2)能够划分目标对象的潜在不可见部分的空间雕刻方法,(3)在大规模图像数据集上预训练的生成模型,可以完成目标的不可见区域,以及(4)神经隐式表面重建方法,用于使用 RGB 图像和单眼几何线索重建对象。这些组件的组合使 POP3D 能够轻松地泛化各种野外图像并生成最先进的重建,其性能显着优于类似的作品。

2.FoleyGen: Visually-Guided Audio Generation

标题:FoleyGen:视觉引导音频生成

作者:Xinhao Mei, Varun Nagaraja, Gael Le Lan, Zhaoheng Ni, Ernie Chang, Yangyang Shi, Vikas Chandra

文章链接:https://arxiv.org/abs/2304.06018

摘要:

大规模深度学习模型和广泛数据集的发展推动了音频生成领域的最新进展。然而,视频到音频(V2A)生成的任务仍然是一个挑战,主要是因为高维视觉和听觉数据之间的复杂关系,以及与时间同步相关的挑战。在本研究中,我们介绍了 FoleyGen,一个基于语言建模范式构建的开放域 V2A 生成系统。FoleyGen 利用现成的神经音频编解码器在波形和离散标记之间进行双向转换。音频令牌的生成由单个 Transformer 模型促进,该模型以从视觉编码器提取的视觉特征为条件。V2A 生成中的一个普遍问题是生成的音频与视频中的可见动作不一致。为了解决这个问题,我们探索了三种新颖的视觉注意机制。我们进一步对多个视觉编码器进行了详尽的评估,每个编码器都经过单模态或多模态任务的预训练。VGGSound 数据集上的实验结果表明,我们提出的 FoleyGen 在所有客观指标和人类评估方面都优于以前的系统。

3.Investigating the Catastrophic Forgetting in Multimodal Large Language Models

标题:研究多模态大语言模型中的灾难性遗忘

作者:Yuexiang Zhai, Shengbang Tong, Xiao Li, Mu Cai, Qing Qu, Yong Jae Lee, Yi Ma

文章链接:https://arxiv.org/abs/2309.10313

摘要:

随着 GPT4 的成功,人们对多模态大语言模型 (MLLM) 研究的兴趣激增。该研究方向侧重于通过微调预训练的法学硕士和视觉模型来开发通用的法学硕士。然而,灾难性遗忘是一种臭名昭著的现象,即微调模型无法保持与预训练模型相似的性能,这仍然是多模态 LLM(MLLM)中的固有问题。在本文中,我们介绍了 EMT:评估多模态,通过将每个 MLLM 视为图像分类器来评估 MLLM 中的灾难性遗忘。我们首先应用 EMT 来评估几个开源的微调 MLLM,我们发现几乎所有评估的 MLLM 都无法在标准图像分类任务上保持与其视觉编码器相同的性能水平。此外,我们继续对 MLLM LLaVA 进行微调,并利用 EMT 来评估整个微调过程中的性能。有趣的是,我们的结果表明,通过增强文本和视觉特征的对齐,对图像数据集进行早期微调可以提高其他图像数据集的性能。然而,随着微调的进行,MLLM 开始产生幻觉,导致通用性显着损失,即使图像编码器保持冻结状态也是如此。我们的结果表明,MLLM 尚未在标准图像分类任务上表现出与其视觉模型相当的性能,并且当前的 MLLM 微调程序仍有改进的空间。

我正在参与2023腾讯技术创作特训营第二期有奖征文,瓜分万元奖池和键盘手表

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2023-09-24 11:54,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 AiCharm 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档