1

分享此资讯给好友,自动附带您的名片信息

其他

AI智能体的"最后一公里",被这两天的三件事打通了

今日头条2026/08/24 23:08原文

如果把大模型比作一个聪明但懒惰的天才,那么过去两年我们干的事,主要是给他喂书、考他题目。而从8月24日到25日这两天集中爆发的技术新闻看,产业界突然集体换了个问法:怎么让这个天才真正动手干活,而且干得又快又便宜又不出错?答案藏在三个看似不相干、实则同频共振的技术进展里——英伟达把低延迟推理芯片 Groq 3 LPX 推向量产、OpenAI/DeepSeek/阿里密集开源 Agent Harness 框架、中国支付清算协会发布智能体支付自律公约。这三件事凑在一起,恰好补齐了 AI 智能体从"会聊天"到"能办事"的最后一段路。推理芯片打响"毫秒战":Groq 3 LPX 量产意味着什么8月24日,英伟达宣布面向交互式 AI 推理的 Groq 3 LPX 正式全面投产,作为 Vera Rubin 平台的重要组成部分,主打超低延迟 Token 生成。在 Artificial Analysis 测试中,搭载 Gemma 4 31B 模型、10 万 Token 上下文时,它实现了每秒 3400 个输出 Token,刷新该模型的最高纪录;针对智能体编程这类低延迟工作负载,响应速度最高达到近期竞争平台的 4 倍。更夸张的是 Vera Rubin NVL72 在真实智能体负载下的数据:基于 SemiAnalysis 的 AgentX 工作负载、采用 Dee

pSeek V4 Pro 模型,每兆瓦吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降低 35 倍。 码农视角翻译:这就好比原来你叫外卖,骑手隔 10 分钟才应一声;现在你话音刚落,骑手已经敲门。智能体要"边想边做",每一步都要等模型吐字,延迟一高,整个工作流就卡成 PPT。这也是为什么 AMD 数据中心收入上季冲到 67 亿美元、增速超 100%,博通/迈威尔定制芯片、谷歌亚马逊自研 TPU/ASIC、OpenAI 的 "Jalapeno" 芯片都在围攻英伟达——因为大家都看清了,下一站不是"谁的参数多",而是"谁的 Token 吐得快、吐得便宜"。Harness 框架集体开源:智能体的"操作系统"来了光有快芯片还不够。8月24日,OpenAI、DeepSeek、阿里相继开源 Codex / DSH / Qoder Harness,把驱动 AI 智能体的底层执行框架摆上了货架,且以 Apache-2.0 这类宽松许可发布。所谓 Harness,你可以把它理解成智能体的"车间流水线"——模型是工人,Harness 是传送带、机械臂、质检台。它负责把"读文件、调工具、跑代码、等结果、再决策"这一长串动作编排起来。过去这套东西每家厂商自己憋着

本文作者:码农财经

福铁科技

福铁科技

专注支付行业 16 年

0591-83334386
支付系统各类支付接口分账接口银行电子户行业场景化定制方案

分享此资讯给好友,自动附带您的名片信息