简介
腾讯 ARC Lab(Applied Research Center)是腾讯旗下专注于前沿人工智能技术探索的实验室,致力于成为世界级 AI 实验室和行业标杆。ARC 聚焦于计算机视觉、3D 生成、视频理解与生成、图像编辑等领域的创新研究,自 2019 年以来已在 CVPR、ICCV 等顶级学术会议和期刊上发表超过 140 篇论文,并开源了 GFPGAN、YOLO-World、VideoCrafter、SEED-Bench、DepthCrafter 等 70 余个重点项目,在全球 AI 社区获得广泛关注。
主要研究方向与成果
3D 生成与重建
- Pixal3D:像素对齐的图像到 3D 生成新范式,实现高保真 3D 资产生成
- InstantMesh:高效的前馈 3D 网格生成框架,可在数秒内从单张图片生成高质量 3D 模型
- Assembler3D:首个通用 3D 组件装配模型,用于物体组装
视频生成与控制
- TrajectoryCrafter:为任意视频重定向相机运动,生成对应的视频结果
- ToonComposer:基于关键帧和线稿的动漫视频插帧模型,实现中间画与插帧的整合,大幅提升动漫创作效率
- ViewCrafter:对静态场景的任意图片执行相机移动拍摄,生成相应视频
图像生成与编辑
- IC-Custom:图像定制模型,给定参考图像即可生成与之一致 ID 的图像
- PhotoMaker:高效个性化文本到图像模型,可接收任意数量的人脸照片,结合文本提示在数秒内生成高保真、风格多样的定制化人物图像
- BrushNet:轻量级文本引导图像编辑模型,引入画笔式掩码机制,让用户更灵活精确地控制扩散模型的编辑区域
视频理解与基础任务
- ARC-Hunyuan-Video-7B:专为真实世界视频理解任务设计,支持横屏和竖屏视频结构化理解,预训练模型的视频描述总结能力在同规模模型中达到 SOTA,显著超越 Qwen2.5-VL-7B、Qwen2.5-Omni-7B、InternVL-2.5-8B 及 InternVL-3-8B 等模型
- DepthCrafter:具备时间稳定性和丰富细节特征的视频深度估计模型,支持开放世界视频
- YOLO-World:高效的开放词汇目标检测模型
视频理解辅助工具
- ARC-Chapter:将视频拆分为章节,提供带时间戳的片段描述,并生成视频摘要
技术落地与产学研合作
业务应用
ARC 依托腾讯亿级业务场景,通过独特机制将研究成果应用于腾讯内部业务(如 QQ、QQ 空间、腾讯视频、腾讯微视、腾讯新闻、腾讯体育、腾讯动漫、QQ 浏览器、应用宝等)或授权外部业务,定义了从实验室到产业的高效转化范式,目前已有 20 余项成果实现内外部业务落地。
校企合作
ARC 与国内外顶尖高校建立深度合作关系,包括清华大学、北京大学、中国科学技术大学、新加坡国立大学、中国科学院自动化研究所、中国科学院大学、香港大学、浙江大学、复旦大学、华中科技大学、香港理工大学、德州农工大学、南开大学、厦门大学、大连理工大学、上海纽约大学、中国科学院深圳先进技术研究院等。
学术影响力
| 指标 |
数据 |
| 顶级会议/期刊论文 |
140+ 篇 |
| 开源项目 |
70+ 个 |
| 内外部业务落地成果 |
20+ 项 |
适用场景
- 学术研究者:获取计算机视觉、AIGC 等领域的最新研究成果和开源代码
- 开发者:使用 YOLO-World、GFPGAN、VideoCrafter 等工具进行项目开发
- 内容创作者:利用 PhotoMaker、ToonComposer、IC-Custom 等工具提升图像和视频创作效率
- 3D 设计师:通过 InstantMesh、Pixal3D 等快速从图像生成 3D 资产
- 企业用户:了解腾讯 AI 技术成果及其在业务场景中的应用实践