想看特朗普跳《鸡你太美》吗?这个AI技术做到了

2023-11-11 13:10

本文主要是介绍想看特朗普跳《鸡你太美》吗?这个AI技术做到了,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

点击上方“CVer”,选择加"星标"置顶

重磅干货,第一时间送达

蕾师师 发自 凹非寺 
来源:量子位(QbitAI)

只要一张照片、一段视频,就能让特朗普跟着蔡徐坤「唱、跳、Rap、篮球」!

像这样。

这就是来自上海科技大学团队的一项新研究,在提出的新框架内,处理人体图像合成任务。

其中包括人体运动模仿、外观转换和新视角合成等。

并且,该项目的代码、数据集已开源。

建立模仿数据集

首先,研究团队建立了一个具有多种样式、不同人物穿不同衣服的数据集,称为Impersonator(iPER)数据集。

研究人员采集了30个研究对象的数据,他们的体型、身高各不相同。每个研究对象穿着不同的衣服,完成一套指定动作和一套随机动作。

整个数据集有206个视频、包含241564帧画面。

206个视频以特定的命名保存,例如“ xxx_yyy_zzz.mp4”,其中:

  • xxx:演员姓名

  • yyy:外观编号,不同的编号表示不同的衣服

  • zzz:动作类型,1代表姿势,2代表随机姿势

如何保留人物细节特征?

目前,主要是用2D图片来确定肢体的结构和动作,但是这远远不能满足这里的需求。

这里采用了3D网格肢体复原形式来提取动作和姿势,即可以模拟关节的位置和旋转,又能够表现出个性化的身体形状。

但是纹理、样式、颜色又该怎么保留呢?

针对这个问题,研究者提出了注意型液化GAN。

通过降噪卷积自动编码器提取特朗普的身体特征,然后经过GAN不断地训练学习、微调、监督、转化,将低分辨率的模型转变成高分辨率的模型,使输出来的视频图像清晰。

整个模型的工作流程大致如下:

(a)首先,肢体网格恢复模块将每个图像的3D网格图绘制好。

(b)其次,流组模块将计算图像空间中的投影顶点,将图像分成动作前景图和背景图。

(c)最后,GAN模块生成三个层,第一层是背景层,第二层是临摹出来的动作层,第三层是参考保留细节层。

注意型液化GAN

在本文中,不仅提出了注意型液化GAN,还提出了一种带有注意型液化块AttLWB(Attentional Liquid Warping Block),两者共同运作,输出高真的模仿图像。

(a)addWB结构,获取了GTSF的数据,生成自己的数据模型。
(b)(Attentional) Liquid Warping Block结构,基于GSID和GTSF的数据,并经过一系列的运算,生成参数。
(c)AttWB结构层。经过这里,得到了最终的数据结果。

网络架构图

大量的实验证明了这个方法在保持面部特征性、形状一致性和衣服细节等方面很有效。

AI舞蹈动作恶搞,不仅恶搞了特朗普,还有人还恶搞了华盛顿。

微博互联网知名博主说,现在的AI论文Demo越来越不尊重“老人”了。调侃200多岁的华盛顿好吗?这不好。

作者团队介绍

这个科研团队来自于上海科技大学

通讯作者是高盛华,高盛华博士2008年本科毕业于中国科学技术大学,2012年博士毕业于新加坡南洋理工大学,2014年8月加入上海科技大学,任助理教授,研究员。

他的研究方向是计算机视觉、机器学习。

高盛华

第一作者是Wen Liu,2016年在西北工业大学获得了学士学位,目前在上海科技大学攻读博士。主要研究人体三维体重建、图像合成、运动转移等方面。

Wen Liu

还有一位作者是Lin Ma,硕士毕业于哈尔滨工业大学,在香港中文大学获得了博士学位。曾经是华为诺亚方舟实验室的研究员,现在是深圳腾讯AI实验室的首席研究员。他目前的研究兴趣在计算机视觉领域、多模式深度学习领域等。

Lin Ma

其他参与的作者还有Zhixin Piao、Zhi Tu、Wenhan Luo 等。

项目地址:
https://www.impersonator.org/work/impersonator-plus-plus.html

数据集下载地址:
https://svip-lab.github.io/dataset/iPER_dataset.html

开源代码地址:
https://github.com/iPERDance/iPERCore

论文地址:
https://arxiv.org/pdf/2011.09055.pdf

下载:CVPR /  ECCV 2020开源代码

后台回复:CVPR2020,即可下载CVPR 2020代码开源的论文合集

后台回复:ECCV2020,即可下载ECCV 2020代码开源的论文合集

重磅!CVer-论文写作与投稿交流群成立

扫码添加CVer助手,可申请加入CVer-论文写作与投稿 微信交流群,目前已满2400+人,旨在交流顶会(CVPR/ICCV/ECCV/NIPS/ICML/ICLR/AAAI等)、顶刊(IJCV/TPAMI/TIP等)、SCI、EI、中文核心等写作与投稿事宜。

同时也可申请加入CVer大群和细分方向技术群,细分方向已涵盖:目标检测、图像分割、目标跟踪、人脸检测&识别、OCR、姿态估计、超分辨率、SLAM、医疗影像、Re-ID、GAN、NAS、深度估计、自动驾驶、强化学习、车道线检测、模型剪枝&压缩、去噪、去雾、去雨、风格迁移、遥感图像、行为识别、视频理解、图像融合、图像检索、论文投稿&交流、PyTorch和TensorFlow等群。

一定要备注:研究方向+地点+学校/公司+昵称(如论文写作+上海+上交+卡卡),根据格式备注,可更快被通过且邀请进群

▲长按加微信群

▲长按关注CVer公众号

整理不易,请给CVer点赞和在看

这篇关于想看特朗普跳《鸡你太美》吗?这个AI技术做到了的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/390279

相关文章

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

AI绘图怎么变现?想做点副业的小白必看!

在科技飞速发展的今天,AI绘图作为一种新兴技术,不仅改变了艺术创作的方式,也为创作者提供了多种变现途径。本文将详细探讨几种常见的AI绘图变现方式,帮助创作者更好地利用这一技术实现经济收益。 更多实操教程和AI绘画工具,可以扫描下方,免费获取 定制服务:个性化的创意商机 个性化定制 AI绘图技术能够根据用户需求生成个性化的头像、壁纸、插画等作品。例如,姓氏头像在电商平台上非常受欢迎,

从去中心化到智能化:Web3如何与AI共同塑造数字生态

在数字时代的演进中,Web3和人工智能(AI)正成为塑造未来互联网的两大核心力量。Web3的去中心化理念与AI的智能化技术,正相互交织,共同推动数字生态的变革。本文将探讨Web3与AI的融合如何改变数字世界,并展望这一新兴组合如何重塑我们的在线体验。 Web3的去中心化愿景 Web3代表了互联网的第三代发展,它基于去中心化的区块链技术,旨在创建一个开放、透明且用户主导的数字生态。不同于传统

AI一键生成 PPT

AI一键生成 PPT 操作步骤 作为一名打工人,是不是经常需要制作各种PPT来分享我的生活和想法。但是,你们知道,有时候灵感来了,时间却不够用了!😩直到我发现了Kimi AI——一个能够自动生成PPT的神奇助手!🌟 什么是Kimi? 一款月之暗面科技有限公司开发的AI办公工具,帮助用户快速生成高质量的演示文稿。 无论你是职场人士、学生还是教师,Kimi都能够为你的办公文

Andrej Karpathy最新采访:认知核心模型10亿参数就够了,AI会打破教育不公的僵局

夕小瑶科技说 原创  作者 | 海野 AI圈子的红人,AI大神Andrej Karpathy,曾是OpenAI联合创始人之一,特斯拉AI总监。上一次的动态是官宣创办一家名为 Eureka Labs 的人工智能+教育公司 ,宣布将长期致力于AI原生教育。 近日,Andrej Karpathy接受了No Priors(投资博客)的采访,与硅谷知名投资人 Sara Guo 和 Elad G

【专题】2024飞行汽车技术全景报告合集PDF分享(附原数据表)

原文链接: https://tecdat.cn/?p=37628 6月16日,小鹏汇天旅航者X2在北京大兴国际机场临空经济区完成首飞,这也是小鹏汇天的产品在京津冀地区进行的首次飞行。小鹏汇天方面还表示,公司准备量产,并计划今年四季度开启预售小鹏汇天分体式飞行汽车,探索分体式飞行汽车城际通勤。阅读原文,获取专题报告合集全文,解锁文末271份飞行汽车相关行业研究报告。 据悉,业内人士对飞行汽车行业

AI hospital 论文Idea

一、Benchmarking Large Language Models on Communicative Medical Coaching: A Dataset and a Novel System论文地址含代码 大多数现有模型和工具主要迎合以患者为中心的服务。这项工作深入探讨了LLMs在提高医疗专业人员的沟通能力。目标是构建一个模拟实践环境,人类医生(即医学学习者)可以在其中与患者代理进行医学

AI行业应用(不定期更新)

ChatPDF 可以让你上传一个 PDF 文件,然后针对这个 PDF 进行小结和提问。你可以把各种各样你要研究的分析报告交给它,快速获取到想要知道的信息。https://www.chatpdf.com/

金融业开源技术 术语

金融业开源技术  术语 1  范围 本文件界定了金融业开源技术的常用术语。 本文件适用于金融业中涉及开源技术的相关标准及规范性文件制定和信息沟通等活动。

【北交大信息所AI-Max2】使用方法

BJTU信息所集群AI_MAX2使用方法 使用的前提是预约到相应的算力卡,拥有登录权限的账号密码,一般为导师组共用一个。 有浏览器、ssh工具就可以。 1.新建集群Terminal 浏览器登陆10.126.62.75 (如果是1集群把75改成66) 交互式开发 执行器选Terminal 密码随便设一个(需记住) 工作空间:私有数据、全部文件 加速器选GeForce_RTX_2080_Ti