阿里这次把Qwen-Audio-3.0系列语音模型全量上架千问平台,语音识别、语音合成、实时语音交互三款齐上。Artificial Analysis今年7月的语音榜上,三款直接拿下三项第一,官方管这叫“大满贯”。说白了,语音这条赛道,阿里已经抢到先手。
支付宝那边也没闲着。8月17日的智能体商业生态大会上,服务智能体“阿宝”把万余项服务做了AI化,接进5大手机品牌、16家车企。现场还发了AHA协议和全栈智能体商业底座,拉着千问、华为、OPPO、比亚迪、吉利等20多家企业一起搞互联生态。商家开发需求已经排到明年去了,AI智能体这事,确实不是纸上谈兵。
谷歌对生成内容的水印政策松了绑。用户做图片、视频、音乐时,显式水印可以自己选关不关。这项功能会陆续落到Nano Banana、Omni、Lyria这些模型上,优先在Gemini网页端和谷歌视频产品开放。实际上,显式标识关不关,谷歌把选择权直接丢给了用户。
图像编辑评测这边也有新家伙。CPI-Bench基准出炉,专门干真实场景下的编辑效果评估,分通用、实用、智能推理三个子集,还头一回把多图像编辑任务纳了进来。评测结果显示,它对主流模型的区分度更强,排名跟Arena Image Edit Leaderboard高度接近,几乎跟真人判断一个样。
OpenAI那边,人称“CUDA内核之神”的Scott Gray离职了,准备自己去搞神经科学启发的AI方法。硬核工程师出走,对OpenAI肯定不是好消息,但也可能给另类AI路子添把火。