OpenAI 扔出一份 MentalHealthBench,专门测 AI 应对心理健康问题的能力。80 多名持证心理学家参与制定标准,5262 条专家评分细则,覆盖 19 种语言。GPT-6 Astra 拿了第一,57.3%。尴尬的是,临床医生写的参考答案只拿到 38.5%。分数都不高,这块硬骨头目前还没人啃下来。
医疗 AI 的钱也没闲着。OpenEvidence 最近融资 2.5 亿美元,这家公司被叫作"医生版 ChatGPT"。投资方包括多家医院系统和安德森·霍洛维茨,估值冲到 150 亿美元。今年 1 月它的估值还是 120 亿,半年不到涨了 30 亿。资本对临床决策工具的胃口,就摆在这。
学术圈在解决更基础的问题——听不懂。arXiv 上一项研究针对加纳三种语言 Twi、Dagbani 和 Ewe,做青少年健康沟通场景下的语音识别基准测试与领域适配。逻辑很直白:AI 连当地语言都识别不准,健康咨询就无从谈起。这类低资源语言的医疗语音工作,才决定了 AI 医疗落地的下限。
三件事指向同一个方向:评测标准在成型,资本在押注临床,语言覆盖在铺开。但 57.3% 的最高分也在提醒,AI 现在只能分担,替代还谈不上。下一阶段的医疗 AI,拼的是谁更靠谱。