AI工具

开源AI图像生成神器爆火,谷歌Nano Banana 2登场

最近AI画图这圈子真是炸开锅了。一边是GitHub上狂揽两万多星标的开源神器爆火,另一边谷歌那个 Nano Banana 2 又在技术社区吵翻天了。学术界也没闲着,搞出了3D世界预可视化控制的新活儿。说白了,整个赛道正从“画出来就行”往“真正能上手用”狂奔。

开源力量崛起:无限制的AI生成工坊

很多创作者早就受够了各大商用平台那套严苛的审核机制。你脑暴半天想个好点子,结果图渲到一半直接被拦截器掐断,这体验简直倒胃口。GitHub上最近冒出个叫 Open-Generative-AI 的项目,一下拿了2.6万星标。它主打的就俩词:“无限制”、“自托管”。

这项目塞进去了500多个模型。你听过的 Flux、Midjourney、Kling、Sora、Veo,里面全都有。从文生图、图生视频到对口型,能想到的活儿基本包圆了。最狠的是没有内容过滤,直接套着 MIT 开源协议。这意味着啥?开发者大可以自己拉一套环境,搭个私人画图作坊。再也不用四处充 API,也不用天天跟审核算法斗智斗勇了,爽得很。

  • 代码全开源,自己架服务器,数据绝对不出门
  • 大杂烩了500多个主流模型,画图拍片一站搞定
  • 没有任何审查条框,想怎么生成就怎么生成
不过话说回来,自由和监管在开源圈子里向来是块烫手山芋。你把自由全给用户,内容违规的烂摊子迟早得面对,这也是 Open-Generative-AI 绕不开的雷区。

谷歌Nano Banana:提示词工程的新魔法

闭源那边,谷歌最近也砸出了响动。Hacker News 上关于 "Nano Banana" 的帖子热度爆表,两篇文章底下加起来上千条留言。实际上,Nano Banana 就是谷歌 Gemini 画图模型的一个内部代号。名字听着挺逗的,像个整活儿项目,但实力绝对不能小看。

有意思的是,技术圈摸透了后发现这玩意儿极度吃提示词。GitHub 上甚至有人专门建了个叫 awesome-nano-banana-pro-prompts 的库,硬生生攒了一万多条精选咒语。还配了预览图,支持16种语言。就这么个提示词语料库,硬是拿下了1.3万星标。

这说明啥?模型再猛,你喂不进去好词也是干瞪眼。Nano Banana 2 发出来后,大伙儿发现只要咒语念得够精细,出图的细节和情绪张力简直绝了。与其天天盼着参数变大,真不如把提示词的潜力给榨干。这也解释了为啥一个词库能这么抢手。提示词工程早就不是早期的“玄学”盲盒了,正儿八经变成了一门手艺。

从单次生成到3D世界:可控性的终极进化

不过话说回来,光靠提示词去捏单张图或者一段视频,还是太单薄。arXiv 上最近有篇叫 StateFlow 的论文,一针见血扎了现有生成方法的软肋。现在的 AI 画图基本是一锤子买卖,你丢进去一段词,它吐给你一张图或一段视频。你想精调里面的几何关系、镜头走位?门都没有,费老劲了。

StateFlow 倒腾出了一套给预可视化做3D世界状态构建的法子。它把生成过程拆成了几何、外观这些独立模块,让创作者能像搭积木一样一点点改场景。这等于把 AI 画图从“抽卡玄学”硬拽成了真正的“干活工具”。干电影、做游戏、搞建筑设计的,要的就是对镜头、动作和时空动态的精准拿捏。能反复修改的高可控工具,才是这帮人的刚需。

我的判断:控制权决定下半场胜负

把这几件事儿拎出来一拼,AI 画图的脉络就特清晰了。一头,Open-Generative-AI 带头的开源帮派在疯狂砸门槛,靠无限制、大杂烩拉拢人心;另一头,谷歌 Nano Banana 坐实了闭源在细节拿捏上的斤两;学术界这帮人则在死磕更深层的空间一致性和控制力。

我认为,接下来大家拼的早就不是“谁出的图更真”,而是“谁能把生成过程捏得更准”。开源发牌了自由,提示词抠出了细腻度,StateFlow 这类研究搭出了结构化控制力。这三样凑齐,才是 AI 画图真正能进厂干活的底牌。对普通用户和开发者来说,现在真别干等着了,多上手折腾折腾开源工具,练练提示词,比眼巴巴指望大厂发善心强太多了。