语音不是功能,是入口:ElevenLabs 如何把 AI 拉进真实世界
多数人还把语音 AI 当成配音工具时,ElevenLabs 的创始人已经在讨论另一件事:当“声音”成为 AI 的默认界面,整个 AI 产品形态都会被重写。这场在红杉资本的对话,透露了一个正在逼近的拐点。
多数人还把语音 AI 当成配音工具时,ElevenLabs 的创始人已经在讨论另一件事:当“声音”成为 AI 的默认界面,整个 AI 产品形态都会被重写。这场在红杉资本的对话,透露了一个正在逼近的拐点。
当所有人都在讨论更大的模型、更贵的Token时,Google DeepMind在这场分享里反复强调了一件“反直觉”的事:真正能跑起来的AI,必须回到设备本身。从Gemma 4到端侧Agent,这不是性能妥协,而是一场架构转向。
大多数人还在比模型参数,Google DeepMind 却在公开课上反复强调一件反直觉的事:Agent 成败不在模型,而在“循环、工具和缓存”。这场从 API Key 到语音 Agent 的现场演示,暴露了下一代应用的真实门槛。
如果你还以为“做AI应用”等于调模型参数,这场来自Google DeepMind的演示会让你彻底改观。Paige Bailey用一小时,把多模态模型、AI Studio、世界模型和一键部署串成了一条几乎不用写代码的生产线。
在所有人都在追逐更大参数、更强算力时,Liquid AI 的 Maxime Labonne 反其道而行:专注 3.5 亿到 240 亿参数的小模型,并且明确说——小模型不是大模型的“缩水版”。这场分享,几乎逐条拆掉了从大模型时代继承下来的错误直觉。
Google DeepMind 悄悄干了一件“反直觉”的事:没有堆参数、没有锁生态,却用 Gemma 4 把开源模型直接送进榜单前六。从 31B 多模态到能跑在设备端的小模型,这次更新释放了一个强烈信号——下一轮 AI 竞争,不再只属于巨无霸模型。
当所有人都在追逐更大的语言模型时,语音AI却悄悄走在一条更难、更慢、也更接近“人”的路上。ElevenLabs 创始人 Mati Staniszewski 在 Stripe 的这场对谈里,几乎把语音AI的技术演进、数据真相和商业化底牌全摊开了。
“我们永远不会知道中本聪是谁,而且这反而是好事。”CZ在这场访谈中抛出的这句话,比任何市场预测都更锋利。从监管、隐私到AI与区块链的融合,这位币安创始人给出了不少反直觉却极具启发性的判断,尤其值得每一个AI从业者认真读完。
当大多数人还在比拼模型参数和准确率时,这场关于 VoiceOps 的演讲抛出一个更残酷的现实:真正拖垮语音AI落地的,不是模型不够强,而是整个音频工作流“太痛苦”。如果你在做语音识别或生成式AI,这是一篇会让你重新审视架构设计的文章。
一条来自 Anthropic 的确认信息,让整个 AI 圈瞬间安静——新模型的能力,被形容为“相较 Opus 的一次断层式跃迁”。更反常的是,它甚至还没发布。同时,Google、OpenAI、Shopify 的一连串动作,正在悄悄拼出下一阶段 AI 竞争的真实轮廓。