千万小时数据集与百亿下载:中国AI开源杀入巨头腹地
AI行业

千万小时数据集与百亿下载:中国AI开源杀入巨头腹地

开源AI生态最近动作频频,底层数据和商业变现都在狂飙。LAION刚甩出一个重磅炸弹——LAION-BVD大规模开源视频数据集。他们直接从CommonCrawl扒了13亿个视频链接,最终筛出8000万个可用视频,总时长直接冲破千万小时大关。这对做多模态预训练的团队来说,简直是送上门的重火力弹药。

底座弹药管够,中国大模型的全球成绩单也相当亮眼。工信部在“十五五”开局发布会上交了底,“十四五”期间我国AI开源大模型全球累计下载量突破100亿次。这个数字直接证明了咱们在开源研发上的硬实力。中国AI技术已经在全球开源生态里站稳了脚跟,别人想忽视都难。

有了百亿下载打底,中国AI企业不再满足于刷榜,而是直接去巨头地盘抢钱。月之暗面正跟微软、亚马逊、谷歌这三大美国云巨头深入谈判,想让对方托管自家的开源模型Kimi K3。他们开出的条件很硬气,要求最高30%的服务收入分成。条款跟开放权重模型大客户的待遇完全一致。

这波谈判要是成了,将是中国AI企业跟美国大厂的首个重要商业合作。从千万小时的数据集,到百亿次的全球下载,再到出海跟巨头谈分成。开源早就不是免费的午餐,而是真金白银的商业筹码。开源AI的牌桌已经彻底变了。