1M上下文、200tokens/s:三家大模型同日上新
同一天,三家厂商把新模型摆上了货架。阿里上线 Qwen3.8-Omni-Flash ,上下文拉到 1M ;智谱发布 GLM-5.3-FlashX ,推理速度标到 200tokens/s ;谷歌则更新了 Gemini 4 Pro 。三个名字里都带着"快"和"长"的意味,这不是巧合。 过去一年,大模型的参数竞赛逐渐让位于另一场比拼:谁能把推理做得更快、把上下文撑得更长。Flash 这个后缀,正在成为各家产品线里的固定席位。 模型之外,硬件也在动 苹果被曝出正在自研 AI 服务器,代号 Baltra ,搭载 M8 Ultra 。这条消息的分量在于方向:一家以终端设备见长的公司,把触角伸向了底层算力。 另一头, Booster K1 人形机器人正式开售。从纯软件到具身智能实体,AI 的落点正在变重。 把这两件事放在一起看,逻辑是连贯的——模型能力要落地,需要算力托底,也需要能跑起来的物理载体。 端侧和垂直场景在悄悄铺开 特斯拉把豆包大模型的语音助手扩展到了更多车型。腾讯则在内部测试 AI 语音助手 Chatterfly ,特点是本地化存储。 车载和隐私计算,是两个具体得不能再具体的场景。语音助手进车,解决的是驾驶场景下的交互;本地化存储,回应的是用户对数据去向的顾虑。 这些动作不像模型发布那样有话题度,但它们决定了 AI 能不能真正被用起来。 从当天的动态看,行业同时在三个层面推进:模型层拼速度和上下文,基础设施层拼算力自主,应用层拼场景渗透。三条线各自独立,又互相咬合。 特别
发表评论