-
Casevo – 中国传媒大学推出的开源社会传播模拟系统
Casevo项目简介 Casevo(Cognitive Agents and Social Evolution Simulator)是中国传媒大学数据科学与智能媒体传播学院、中国传媒大学媒体融合与传播国家重点实验室联合推出的开源社会传播模拟系统。结合大语言模型和多智能体技术,基于模拟人类认知、决策和社会交互理解和预测社会传播现象。Casevo用模块化架构,支持从场景设置到复杂社会网络建模的完整仿真…- 2
- 0
-
DrivingDojo – 中科院联合美团推出的交互式驾驶世界模型数据集
DrivingDojo项目简介 DrivingDojo是中国科学院自动化研究所与美团无人车团队合作推出的数据集,用在训练和研究复杂的自动驾驶交互式世界模型。数据集包含18,000个视频片段,覆盖完整的驾驶操作、多智能体交互以及丰富的开放世界驾驶知识,为开发下一代自动驾驶模型提供了坚实的基础。DrivingDojo定义了动作指令跟随(AIF)基准,用在评估世界模型在执行动作控制的未来预测方面的能力。…- 1
- 0
-
Baichuan-Audio – 百川智能开源的端到端语音交互模型
Baichuan-Audio项目简介 Baichuan-Audio是百川智能推出的端到端音频大语言模型,支持无缝集成音频理解和生成功能,实现支持高质量、可控的实时中英双语对话。Baichuan-Audio基于多码本离散化技术将音频信号转化为离散标记,保留语义和声学信息,用独立的音频头增强音频特征处理能力。模型基于两阶段预训练策略,结合交错数据训练,平衡音频建模和语言理解能力。Baichuan-Au…- 1
- 0
-
DreamO – 字节联合北大推出的图像定制生成框架
DreamO项目简介 DreamO 是字节跳动创作团队联合北京大学深圳研究生院电子与计算机工程学院联合推出的用在图像定制生成的统一框架,基于预训练的扩散变换器(DiT)模型实现多种图像生成任务的灵活定制。DreamO 支持身份、主体、风格、背景等多种条件的无缝集成,基于特征路由约束和占位符策略提升生成结果的一致性和条件解耦能力。DreamO 用分阶段训练策略,确保模型在复杂任务中高效收敛保持高质量…- 3
- 0
-
HeadGAP – 字节跳动推出的3D头像生成模型
HeadGAP项目简介 HeadGAP是字节跳动和上海科技大学共同推出的3D头像生成模型,仅用少量图片快速生成逼真的3D头像。采用先验学习和个性化创建阶段的框架,基于大规模多视角动态数据集导出的3D头部先验信息。通过高斯Splatting自动解码网络和部分动态建模,结合身份共享编码与个性化潜在代码,HeadGAP实现了高保真度和可动画的3D头像,具有多视图一致性和稳定动画效果。 HeadGAP优势…- 2
- 0
-
SPAR – 智谱团队推出的自我博弈训练框架
SPAR项目简介 SPAR是智谱团队推出的自我博弈框架,能增强大型语言模型在遵循指令方面的能力。框架基于内部的生成者和完善者两个角色进行互动,生成者执行指令生成回复,完善者对回复进行分析和改进。SPAR基于树搜索技术精细化和优化回复,排除无关的干扰因素,从而突出对指令遵循至关重要的关键差异。这一过程提升了模型执行指令的准确性,增强了模型的自我完善能力。实验结果显示,SPAR框架能显著提高模型在IF…- 1
- 0
-
MagicClay – Adobe 推出的3D建模工具,文本引导3D模型局部雕刻
MagicClay项目简介 MagicClay 是 Adobe 推出3D建模工具,结合网格和有向距离场(SDF)技术,支持艺术家基于文本提示对3D模型的特定部分进行雕刻,同时保持模型的其他区域不变。MagicClay 支持生成具有纹理的三维模型,能非破坏性地编辑局部网格,让艺术家用文本提示为基础,对3D模型进行更直观和更精细的编辑。MagicClay 将文本到图像的生成能力转化为艺术家在迭代工作流…- 1
- 0
-
Insert Anything – 浙大联合哈佛大学和南洋理工推出的图像插入框架
Insert Anything项目简介 Insert Anything是浙江大学、哈佛大学和南洋理工大学的研究人员联合推出的基于上下文编辑的图像插入框架。框架基于将参考图像中的对象无缝插入到目标场景中,支持多种实际应用场景,如艺术创作、真实人脸替换、电影场景合成、虚拟试穿、配饰定制和数字道具替换等。Insert Anything基于包含120K提示图像对的AnyInsertion数据集训练,能灵活…- 1
- 0
-
DisPose – 北大等多所高校推出的增强人物图像控制动画质量的技术
DisPose项目简介 DisPose是北京大学、中国科学技术大学、清华大学和香港科技大学的研究团队共同推出的,提高人物图像动画质量的控制技术,基于从骨骼姿态和参考图像中提取有效的控制信号,无需额外的密集输入。DisPose将姿态控制分解为运动场引导和关键点对应,生成密集运动场以提供区域级引导,同时保持对不同体型的泛化能力。DisPose包括一个即插即用的混合ControlNet,能改善现有模型生…- 1
- 0
-
南洋理工联手上海AI Lab发布PhysX-3D 给AI生成的3D模型注入“物理灵魂”!
3D生成补上物理短板!当我们还在为Midjourney的绝美画作和Sora的电影级视频惊叹时,一个更加根本性的问题正悄然浮现:为什么这些AI创造的3D世界总给人一种"塑料感"? 答案很简单,它们缺乏物理灵魂。现实世界中的每一件物品都遵循着严格的物理定律,椅子有重量和硬度,笔记本电脑的屏幕能够翻开,材质决定了手感和散热性能。然而,现有的AI生成3D模型只关心外表是否逼真,完全忽略…- 2
- 0
-
sCM – OpenAI推出连续时间一致性模型,两步采样生成高质量图像
sCM项目简介 sCM是OpenAI推出的连续时间一致性模型,基于扩散模型原理进行改进。sCM简化理论框架和优化采样过程,实现图像生成速度的显著提升。sCM模型仅需两步采样能生成高质量图像,速度比传统扩散模型快50倍。基于连续时间框架,避免离散化误差,用一系列关键改进如改进的时间条件策略和自适应双归一化,提高模型训练的稳定性和生成质量。sCM的发布预示着实时、高质量生成式AI在多个领域的应用前景,…- 0
- 0
-
MLE-bench – OpenAI推出AI代理性能评估的基准测试工具
MLE-bench项目简介 MLE-bench 是 OpenAI 推出的一个基准测试工具,旨在衡量AI代理(AI Agent)在机器学习工程任务中的表现。测试包含75个来自 Kaggle 的竞赛任务,覆盖自然语言处理、计算机视觉和信号处理等多个领域。AI 代理在这个环境中完成理解比赛描述、处理数据集、训练模型、提交结果等一系列任务,最终根据排行榜得分评估能力。MLE-bench 的设计注重挑战性和…- 0
- 0
-
XGrammar – 陈天奇团队推出的LLM结构化生成引擎
XGrammar项目简介 XGrammar是由陈天奇团队推出的开源软件库,能为大型语言模型(LLM)提供高效、灵活且可移植的结构化数据生成能力。基于上下文无关语法(CFG)定义结构,支持递归组合以表示复杂结构,适合生成JSON、SQL等格式数据。XGrammar用字节级下推自动机优化解释CFG,减少每token延迟,实现百倍加速,几乎无额外开销。XGrammar集成多种系统优化,如自适应token…- 0
- 0
-
ViTPose – 基于 Transformer 架构的人体姿态估计模型
ViTPose项目简介 ViTPose 是基于 Transformer 架构的人体姿态估计模型。以普通视觉 Transformer 作为骨干网络,通过将输入图像切块并送入 Transformer block 来提取特征,再经解码器将特征解码为热图,实现对人体关键点的精准定位。ViTPose 系列模型具有多种规模版本,如 ViTPose-B、ViTPose-L、ViTPose-H 等,可根据不同需求…- 0
- 0
-
SwiftBrush V2 – 文本到图像的单步扩散模型,性能与多步模型相媲美
SwiftBrush V2项目简介 SwiftBrush V2 是文本到图像的单步扩散模型,通过改进训练方法和模型融合技术,实现与多步Stable Diffusion扩散模型相媲美的性能。模型通过更好的权重初始化、高效的LoRA训练,引入一种新颖的夹紧CLIP损失来增强图像与文本的对齐,提高图像质量。SwiftBrush V2 的训练不需要使用真实的图像数据,降低了训练成本提高了数据效率。 Swi…- 4
- 0
-
StreamingT2V – PicsArt推出的可生成长达2分钟视频的模型
StreamingT2V项目简介 StreamingT2V是由PicsArt AI研究团队推出的一个文本到视频的生成模型,旨在解决现有模型仅能生成16帧或24帧的高质量短视频,而当在生成长视频时则会遇到如视频质量下降、场景转换不一致和视频停滞等问题的挑战。StreamingT2V通过引入条件注意模块(CAM)和外观保持模块(APM)以及随机混合方法,实现了长视频(最长达1200帧、时长2分钟)的流…- 2
- 0
-
TANGO – 东京大学和CyberAgent AI Lab推出声音驱动全身手势视频生成框架
TANGO项目简介 TANGO 是一个由东京大学和 CyberAgent AI Lab 共同推出的开源框架,专注于生成与目标语音同步的全身手势视频。基于分层音频运动嵌入和扩散插值网络,将目标语音音频与参考视频库中的动作完美匹配,确保制作出高保真度、动作同步的视频。TANGO 技术突破极大地降低视频内容制作的成本,包含新闻播报、虚拟人解说和虚拟 YouTube 内容创作等领域,为用户提供一种高效且经…- 1
- 0
-
See3D – 智源研究院开源的无标注视频学习3D生成模型
See3D项目简介 See3D(See Video, Get 3D)是北京智源人工智能研究院推出的3D生成模型,能基于大规模无标注的互联网视频进行学习,实现从视频中生成3D内容。与传统依赖相机参数的3D生成模型不同,See3D采用视觉条件技术,仅通过视频中的视觉线索生成相机方向可控且几何一致的多视角图像。避免了昂贵的3D或相机标注的需求,能高效地从互联网视频中学习3D先验。See3D支持从文本、单…- 1
- 0
-
VideoJAM – Meta 推出增强视频生成模型运动连贯性的框架
VideoJAM项目简介 VideoJAM是Meta推出的,用在增强视频生成模型运动连贯性的框架。基于引入联合外观-运动表示,让模型在训练阶段同时学习预测视频的像素和运动信息,在推理阶段基于模型自身的运动预测作为动态引导信号,生成更连贯的运动。VideoJAM在训练目标中加入运动预测,在推理时采用Inner-Guidance机制,显著提升视频生成中的运动连贯性,同时保持视觉质量。VideoJAM具…- 1
- 0
-
GaussianEditor – 一种3D编辑算法,支持快速且精确地修改3D场景
GaussianEditor项目简介 GaussianEditor 是一种基于高斯飞溅(Gaussian Splatting)的3D编辑算法,支持用户快速而精确地修改3D场景。通过高斯语义跟踪和分层高斯飞溅,提供了高度的编辑控制和稳定性,同时保持了渲染质量。编辑过程通常只需5-10分钟,显著提高了3D编辑的效率。这项技术特别适合游戏开发和虚拟现实等领域,具有广泛的应用前景。 GaussianEdi…- 0
- 0
-
CHANGER – AI换头技术,将演员头部无缝集成到目标身体
CHANGER项目简介 CHANGER是工业级超自然AI换头与色键技术,用在数字内容创作中将演员头部无缝集成到目标身体上,适于视觉特效、数字人类创建和虚拟化身。CHANGER基于色键技术分离背景与前景,用H2增强模拟多样头部形状和发型,及FPAT模块预测、聚焦关键区域,实现高保真融合。CHANGER在性能上超越现有技术,适用于多种真实场景。 CHANGER优势介绍 高保真头部融合:将演员的头部无缝…- 1
- 0
-
DreamPolish – 智谱AI、清华、北大联合推出的文本到3D生成模型
DreamPolish项目简介 DreamPolish是智谱 AI、清华大学和北京大学推出的文本到3D生成模型,基于两阶段方法改进复杂对象的精细几何结构和高质量纹理的生成。第一阶段用多种神经表示逐步细化几何形状,基于抛光阶段改善表面细节。第二阶段用领域得分蒸馏技术,引导纹理生成朝向结合逼真度和一致性的目标领域,显著提升纹理质量。DreamPolish在几何和纹理方面均超越现有技术,为3D资产创造开…- 0
- 0
-
ObjectMover – 港大联合 Adobe 推出的新型图像编辑模型
ObjectMover项目简介 ObjectMover 是香港大学和 Adobe Research 联合提出的新型图像编辑模型,解决图像中物体移动、插入和移除时出现的光照、阴影不协调以及物体失真等问题。将物体移动视为两帧视频的特殊案例,利用预训练视频生成模型的跨帧一致性学习能力,通过微调模型将其迁移到图像编辑任务。模型采用序列到序列建模,输入包括原始图像、目标物体图像和指令图,输出为物体移动后的合…- 0
- 0
-
DreamOmni – 港中文、字节等机构共同推出的统一图像生成和编辑模型
DreamOmni项目简介 DreamOmni 是香港中文大学、字节跳动和香港科技大学共同推出的统一图像生成和编辑模型。模型整合文本到图像(T2I)生成和多种编辑任务,包括指令式编辑、修复、拖拽编辑和参考图像生成。DreamOmni 基于一个高效的合成数据管道解决高质量编辑数据的创建难题,支持模型训练和扩展。基于联合训练T2I和编辑任务,强化对概念的理解并提升图像生成质量。在广泛的实验评估中,Dr…- 2
- 0