最近扒拉着GitHub和arXiv上看机器学习的热门项目和论文,我有个特别直接的观感:这行当已经彻底撕裂了。一头是卷了这么些年的基础框架,另一头是越来越看不懂的Agent前沿探索。夹在中间的呢?是一大堆想入坑却连门往哪开都不知道的新手。这三拨人都在低头猛跑,但互相根本看不见。
框架之争:TensorFlow老去,Transformers当道
先聊聊基建。TensorFlow在GitHub上挂着快二十万颗星,说实话,这数字基本就是张历史功劳簿。实际敲代码的时候,除了工业部署那摊事儿还在硬扛着用TF,搞研究的、写新项目的早就全跑去PyTorch了。再看HuggingFace的Transformers库,16.4万星,眼瞅着就要追平TensorFlow。你得想想这两玩意儿差了多少岁,这个反超速度简直夸张。
Transformers凭啥火成这样?其实很简单。它把BERT、GPT、LLaMA、Qwen、DeepSeek这些主流玩意的调用方式给统一了。你再也不用为了跑通一个模型去死啃一套天书般的API。文本、图像、音频、多模态,一个框架全给你包圆了。说白了,它就是把玩大模型的门槛给踩平了,门槛一没,人自然就乌泱泱地涌进来了。
不过话说回来,我觉得更有意思的是它Topics底下的那几个标签:deepseek、gemma、glm、qwen。国产开源模型现在直接跟海外大佬们并排坐在同一个框架的核心标签里了。这信号,比看一百份市场份额报告都来得猛烈。
- TensorFlow:19.7万星,底层以C++为主,工业部署还能打,但在研究圈子的地盘是越来越小了
- Transformers:16.4万星,Python亲儿子,文本视觉音频多模态一把梭,快成了调大模型的事实标准
- 核心趋势:框架打架早就不看"谁的API好用"了,现在拼的是"谁家模型地盘大"
AVA-Encoder:让AI真正"看懂"电影
arXiv上那篇AVA-Encoder的论文,算是踩中了一个特别实在的痛点:现在的创意Agent压根学不了高质量人类电影里的玩意儿。听着挺扯吧?都2024年了,AI连电影都看不明白?实际还真是。毛病出在视频表示这块——现在的视频编码,要么把关键信息丢了个精光,要么弄出来的表示向量,Agent根本拿来没法做推理。
AVA-Encoder的套路,是搞出一套"Agent原生"的视频表示法。用agentic auto-encoding把视频转成一种结构化表示。这东西既得忠于原片,还得让Agent直接拿来就能推理。我认为这方向被严重看扁了。现在满世界都在卷怎么生成视频,但视频理解呢?尤其是那种能让Agent看着视频做决策的理解,基本没几个人搞出靠谱的方案。
如果创意AI真想搞出电影级别的片子,它得先学会怎么"读"电影。AVA-Encoder走的就是这条道,而不是在生成端死磕。
论文里有个点挺关键:现在的视频表示,要么奔着重建质量去(死磕编码解码保真度),要么是为了下游任务(分类、检测),偏偏就没有冲着Agent推理去的。AVA-Encoder就是想填这个坑,让视频表示能被Agent直接拿来做规划和操作。这条路要是真能走通,那影响的可不光是视频生成,连Agent的长期记忆和经验积累都能跟着沾光。
测试时能力迁移:不训练也能变强
另一篇叫AI4AI at Test-Time的论文,抛出个挺反直觉的问题:模型想搞能力迁移,难道非得更新参数不可?传统的蒸馏,都是大模型当老师,小模型当学生,在训练阶段把参数一通改,硬塞过去。但这篇论文偏要问:推理的时候,让大模型给小模型搭个"脚手架",直接领着小模型把题做对,行不行?
这思路实际上挺鸡贼的。很多时候你手头就一个开源小模型,搞不起全量蒸馏,但活儿又得有大模型的效果。这时候要是在推理时,强模型能自动整出一套辅助逻辑——搞个提示词链啥的,让弱模型照猫画虎,那不就等于白嫖了一波能力嘛。论文里用了四个推理基准测过,确实有效。
不过话说回来,我对此也就持个谨慎乐观的态度。测试时搭脚手架,说白了是在推理开销上做文章。你是把训练的钱省了,但每次推理都得跑这套逻辑。到底划不划算,全看你那边调用多频繁。要是高频场景,这笔账真不一定算得过。再说了,强模型搭的这脚手架到底行不行也是个问号——要是它自己就有偏差,那弱模型只会被带跑偏得更系统。
入门这件事:两年撞墙不如找对路
Hacker News上有俩机器学习入门资源最近挺火。一个是谷歌的Machine Learning Crash Course,快两千分了。另一个是某位开发者攒的Machine Learning 101 slide deck,副标题起得实在:"两年的头破血流,所以你不用再撞了"。一千六百多分,评论区有一百来号人唠。
这俩能火,恰恰说明机器学习的门槛根本没降多少。框架是越来越好用了,API也写得越来越干净,但底层的那些硬核概念呢?梯度下降、反向传播、过拟合、正则化——这些东西不会因为你用了Transformers就能自动懂。我见过太多人上来就调API,模型一不收敛直接傻眼,连该调啥都不知道。
那位兄弟花两年整理出一套slides,本质上就是把散落在各地的入门知识给捋顺了。这玩意儿的价值不在内容多新鲜,关键是有人替你把坑都踩过了,路给排好序了。
谷歌那个Course也是一个道理。大厂免费放出来的,质量有底。但说实在的,入门资源从来都不缺,缺的是适合你自身底子的那一版。数学好的嫌人家讲得太浅,没基础的又嫌人家跳步太快。这两份资源能在HN上同时霸榜,说明它们各自拿捏住了一拨人的痛点。
说到底,机器学习这摊事儿现在就是个撕裂的状态。工具链这头,TensorFlow和Transformers这些框架早把使用门槛踩到了历史最低点;研究那头,Agent视频理解、测试时能力迁移这些方向还在满地跑马圈地;入门这边呢,两年撞墙的痛苦依然每天都在上演。你站在哪一头,决定了你眼里看到的是个怎样的机器学习。调框架的觉得一切都很简单,搞研究的觉得难题一个都没破局,刚入门的觉得每扇门背后全是墙。这种撕裂短期内根本抹不平,前沿越往前推,这头裂得只会越狠。