新京报客户端

好新闻 无止境

立即打开
通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话
新京报 记者 罗亦丹 编辑 陈莉
2025-01-28 19:32

新京报贝壳财经讯(记者罗亦丹)1月28日,阿里云通义千问开源全新的视觉模型Qwen2.5-VL,推出3B、7B和72B三个尺寸版本,并已在魔搭社区、HuggingFace等平台开源。


其中,旗舰版Qwen2.5-VL-72B在13项权威评测中的得分领先GPT-4o与Claude3.5。新的Qwen2.5-VL能够更准确地解析图像内容,支持超1小时的视频理解,无需微调就可变身为一个能操控手机和电脑的AI视觉智能体(Visual Agents),实现给指定朋友送祝福、电脑修图、手机订票等多步骤复杂操作。


Qwen2.5-VL识别和定位马路上骑摩托车未戴头盔的人。官方供图


通义团队此前曾开源Qwen-VL及Qwen2-VL两代模型,而新的Qwen2.5-VL视觉知识解析能力实现了飞跃,如准确识别和定位马路上骑摩托车未戴头盔的人,或是以多种格式提取发票中的核心信息并做结构化的推理输出。其视频理解能力也得到了增强,可以在视频中搜索具体事件,并对视频的不同时间段进行要点总结,打开摄像头,用户就能与Qwen2.5-VL实时对话。


开发者基于Qwen2.5-VL也能开发属于自己的AI智能体,如自动核验快递单地址与照片中的门牌号是否对应,根据家庭摄像头判断猫咪状况进行自动喂食,自动进行火灾报警等。


编辑 陈莉 校对 穆祥桐

来阅读我的更多文章吧
罗亦丹
新京报记者
记者主页
相关推荐
新质生产力如何重塑影像未来?vivo交出“中国方案”
科技
大模型震荡时刻:DeepSeek掀桌百度开源 免费成必答题
科技
​实探|一夜爆火的Manus,背后团队是什么来头
科技
CES观察|AI眼镜出圈、清洁电器争锋、显示技术升级
科技
万字专访谭待:火山引擎从不赔钱换市场,给豆包大模型打80分
财经
新十年当红不让,REDMI K80系列大满贯双旗舰正式发布
商讯
通义千问开源Qwen2.5 开源模型累计下载量突破4000万
科技
通过摄像头“现场解说” 记者实测国内首个C端视频通话AI应用
科技
中国AI大模型测评报告:公众及传媒行业大模型使用与满足研究
科技

新京报报料邮箱:67106710@bjnews.com.cn