关闭

每日AI快讯

ConceptMaster – 高保真多概念视频定制生成的创新 AI 框架

ConceptMaster是用于多概念视频定制的创新框架,能在无需测试时调优的情况下,在扩散Transformer模型上生成高质量且概念一致的定制视频。框架通过学习解耦的多概念嵌入并将其独立注入扩散模型中,有效解决了多概念视频定制中的身份解耦问题,面对高度相似的视觉概念,能保证每个概念的保真度。

日日新融合大模型 – 商汤科技推出的原生融合模态大模型

“日日新”融合大模型(SenseNova)是商汤科技于2025年1月10日正式推出的多模态大模型。模型实现了原生融合模态,深度推理能力与多模态信息处理能力均大幅提升,能处理文本、图像、视频等多种信息,突破了模态之间的限制在SuperCLUE和OpenCompass两大权威评测榜单均夺得第一,成为“双冠王”。

Agent Laboratory – AMD 联合约翰·霍普金斯大学推出的自主科研 Agent

Agent Laboratory是AMD和约翰·霍普金斯大学推出,基于大型语言模型(LLM)的自主研究框架,能加速科学发现、降低成本并提高研究质量。Agent Laboratory接受人类提供的研究想法,基于文献综述、实验和报告撰写三个阶段,产生全面的研究输出,包括代码库和研究报告。Agent Laboratory支持用户在每个阶段提供反馈和指导,提高研究的整体质量。

新言意码 – 前月之暗面明超平创立的 AI Coding 项目

新言意码是专注于AI编程应用开发的公司,由前月之暗面海外产品Noisee的明超平创立。公司全称深圳新言意码科技有限公司,成立于2024年9月23日,位于广东省深圳市,主要在其他技术推广服务领域经营。

PPTAgent – 中科院推出的自动生成高质量演示文稿框架

PPTAgent是中国科学院软件研究所中文信息处理实验室推出的创新框架,基于模仿人类工作流程的两阶段编辑方法,从文档自动生成高质量的演示文稿。PPTAgent分析参考演示文稿,提取结构模式和内容模式,基于代码动作草拟大纲并生成幻灯片,确保内容的一致性和对齐。

HoloDrive – 商汤联合上海AI Lab等机构推出的2D-3D多模态街道场景生成框架

HoloDrive 是商汤和上海人工智能实验室等机构提出的用于自动驾驶的整体2D-3D多模态街道场景生成框架。框架联合生成相机图像和激光雷达点云,填补自动驾驶中2D-3D多模态联合生成的空白。

Motion Dreamer – 香港科技大学推出的运动合理视频生成框架

Motion Dreamer是香港科技大学(广州)研究者提出的视频生成框架,旨在生成运动合理视频。基于两阶段生成方式,先基于输入图像和运动条件生成中间运动表示,再利用该表示生成高细节视频。其引入实例流这一新运动模态,可实现从稀疏到密集的运动控制,用户通过提供稀疏运动提示,模型能生成时间连贯视频。

Sky-T1 – NovaSky 开源的推理 AI 模型,可从零开始复现该模型

Sky-T1是加州大学伯克利分校Sky Computing实验室的研究团队NovaSky发布的开源推理AI模型,名为Sky-T1-32B-Preview。是首个开源推理模型,训练数据集和代码均已公开,用户可以从零开始复现该模型。

FaceLift – Adobe 联合加州大学推出的单张图像到 3D 头部模型生成技术

FaceLift是Adobe和加州大学默塞德分校推出的单图像到3D头部模型的转换技术,能从单一的人脸图像中重建出360度的头部模型。FaceLift基于两阶段的流程实现:基于扩散的多视图生成模型从单张人脸图像生成一致的侧面和背面视图;生成的视图被输入到GS-LRM重建器中,产出详细的3D高斯表示。FaceLift能精确保持个体的身份特征,生成具有精细几何和纹理细节的3D头部模型。

SVFR – 腾讯优图联合厦门大学推出的通用视频人脸修复统一框架

SVFR(Stable Video Face Restoration)是腾讯优图实验室和厦门大学联合推出的用于广义视频人脸修复的统一框架,整合了视频人脸修复(BFR)、着色和修复任务,基于Stable Video Diffusion(SVD)的生成和运动先验,通过统一的人脸修复框架整合特定于任务的信息。