neng8科技快讯网AI人工智能前沿资讯_汽车数码相机评测_手机电脑硬件百科

QVQ – 阿里通义开源的视觉推理模型

QVQ – 阿里通义开源的视觉推理模型

QVQ是阿里基于Qwen2-VL-72B构建的开源多模态推理模型,结合视觉理解和复杂问题解决能力,提升人工智能的认知能力。QVQ在视觉推理任务中展现出增强的能力,尤其在需要复杂分析思维的领域表现出色。QVQ在MMMU评测中取得了70.3的高分,在各项数学相关基准测试中相比Qwen2-VL-72B-Instruct 有显著提升。
19 0 2025-08-30
LLMDet – 阿里通义联合中山大学等机构推出的开放词汇目标检测模型

LLMDet – 阿里通义联合中山大学等机构推出的开放词汇目标检测模型

LLMDet是阿里巴巴集团通义实验室、中山大学计算机科学与工程学院、鹏城实验室等机构推出的开放词汇目标检测器,基于与大型语言模型(LLM)协同训练提升目标检测性能。LLMDet能收集包含图像、定位标签和详细图像级描述的数据集(GroundingCap-1M),用LLM生成的长描述丰富视觉特征,基于标准的定位损失和描述生成损失进行训练。
22 0 2025-08-29
LHM – 阿里通义开源的单图生成可动画3D人体模型

LHM – 阿里通义开源的单图生成可动画3D人体模型

LHM(Large Animatable Human Reconstruction Model)是阿里巴巴通义实验室推出的从单张图像重建可动画化3D人体模型。基于多模态Transformer架构,融合3D几何特征和2D图像特征,用注意力机制保留服装几何与纹理细节,推出头部特征金字塔编码方案增强面部细节恢复能力。
21 0 2025-08-29
HumanOmni – 阿里通义等推出专注人类中心场景的多模态大模型

HumanOmni – 阿里通义等推出专注人类中心场景的多模态大模型

HumanOmni 是专注于人类中心场景的多模态大模型,视觉和听觉模态融合而成。通过处理视频、音频或两者的结合输入,能全面理解人类行为、情感和交互。模型基于超过240万视频片段和1400万条指令进行预训练,采用动态权重调整机制,根据不同场景灵活融合视觉和听觉信息。
21 0 2025-08-29
ChatAnyone – 阿里通义推出的实时风格化肖像视频生成框架

ChatAnyone – 阿里通义推出的实时风格化肖像视频生成框架

ChatAnyone是阿里巴巴通义实验室推出的实时风格化肖像视频生成框架。通过音频输入,生成具有丰富表情和上半身动作的肖像视频。采用高效分层运动扩散模型和混合控制融合生成模型,能实现高保真度和自然度的视频生成,支持实时交互,适用于虚拟主播、视频会议、内容创作、教育、客户服务、营销、社交娱乐、医疗健康等众多场景。
22 0 2025-08-28
AnyStory – 阿里通义推出的高保真个性化文本到图像生成框架

AnyStory – 阿里通义推出的高保真个性化文本到图像生成框架

AnyStory是阿里巴巴通义实验室研发的创新文本到图像生成框架,实现单个和多个主体的高保真个性化图像生成。通过“编码-路由”的方法来建模主体个性化问题。在编码阶段,AnyStory结合强大的ReferenceNet和CLIP视觉编码器,对主体特征进行高保真度的编码,捕捉丰富的细节和语义信息。
22 0 2025-08-28
Manus与阿里通义达成合作

Manus与阿里通义达成合作

据媒体报道,火爆异常的AI Agent新秀Manus和阿里云旗下大语言模型通义千问达成合作。双方将基于通义千问系列开源模型,在国产模型和算力平台上实现Manus的全部功能;双方将共同推动通用智能体技术的普惠化与商业化落地。 有业界分析人士认为2025或是Agent元年,Manus和阿里的合作标志着国产大模型与智能体技术的深度融合,而且还可能为资本市场带来新一轮投资机遇。比如Manus的迅速出圈后为其商业化合作和融资都创造了很好的条件。 由BUTTERFLY EFFEC
25 0 2025-08-27