
进入2026年10月,全球AI大模型赛道从”超级发布周”的密集轰炸,转向”结构性分化”的深度调整。Google时隔半年终于推出Gemini 4 Argon旗舰模型,却只敢开放给网络安全团队做受控测试;TypeSafe AI的Jev决策模型以”不聊天、不写代码”的差异化路线,短短两周完成8.7亿美元融资、估值75亿美元;OpenAI、Anthropic密集迭代GPT-6.1 Sol和Claude 5.5系列,同时与Salesforce、贝恩等企业深化AI落地。中国这边,DeepSeek Harness开源24小时GitHub揽获7万星,阿里800亿港元配股、智谱50亿美元融资支撑模型能力追赶——这是一个**决策模型兴起、旗舰回归谨慎、Agent商业化兑现、安全政策收紧**的月份。
这是本系列的第十篇。如果你错过了之前的内容,可以先回顾:
一、Google:Gemini 4 Argon,迟来的旗舰与极度谨慎的开放
9月30日,Google DeepMind正式发布Gemini 4 Argon——这是Gemini 4系列推出的首款旗舰模型,也是Google时隔约11个月(上一代旗舰Gemini 3 Pro发布于2025年11月)首次对外推出高于Flash级别的闭源前沿大模型。但发布方式却极为特殊:Argon暂时没有进入普通用户的Gemini界面,而是首先开放给一批受信任的网络安全防御机构,通过受控早期访问项目Fairwind进行测试。Google明确表示,只有在安全护栏进一步完善后,Argon才会逐步向开发者、企业和普通消费者开放。
Argon的核心定位是面向复杂、长流程工作流的旗舰模型,重点覆盖软件工程、法律和金融等企业知识工作,以及网络安全防御。相比上一代,最显著的提升是**单次输出上限从6.4万token提升至100万token**——这意味着模型可以在一次任务中持续生成更长的推理和执行轨迹,大幅减少对人工中途接管的依赖。
在内部评测中,Argon的18项测试领先12项,综合性能超越包括GPT-6系列和Claude Opus 5在内的同期竞品。但Google选择”先给安全团队”而非”先给开发者”的策略,反映了整个行业对旗舰大模型安全风险的共同焦虑——两个月前Astra的循环深度架构引发的”信号损失”争议至今未消。
值得关注的是,在预测市场上,Google的隐含概率反超Anthropic,成为市场认为最有可能在年内推出最佳AI模型的厂商(43% vs 42%)。这可能与Argon的发布有关。
二、Jev:决策模型的横空出世与8.7亿美元融资奇迹
如果说Gemini 4 Argon是10月最”重量级”的旗舰发布,那么Jev就是最”现象级”的新兴选手。TypeSafe AI(成立于2024年,总部旧金山,员工仅20多人)在9月15日发布首款公开模型Jev,10月9日便宣布完成8.7亿美元A轮融资(估值75亿美元,约500亿人民币)——融资速度、金额与估值之间的反差,在AI创业史上实属罕见。
与OpenAI、Anthropic等公司的大语言模型不同,Jev不提供传统的聊天、邮件撰写或代码生成功能,而是直接集成到软件系统中,根据输入信息完成**分类、评分、选择和决策**等任务。TypeSafe将这一技术路线称为”System One Models”(系统一模型),区别于传统LLM逐个生成文本token的方式,Jev可以直接输出结构化决策结果及相应的概率、置信度。
| 对比维度 | 传统LLM | Jev决策模型 |
|---|---|---|
| 输出形式 | 逐个token生成文本 | 直接输出结构化决策结果 |
| 应用场景 | 聊天、写代码、内容生成 | 分类、路由、评分、动作选择 |
| 推理速度 | 基准 | 最高近200倍 |
| 成本 | 基准 | 降低超400倍 |
| 输入价格 | 基准 | $0.042/百万token |
| 输出价格 | 基准 | 免费 |
TypeSafe还开发了名为RLCD(Reinforcement Learning for Calibrated Decisions)的训练方法,重点提升模型决策结果的可靠性及概率预测的准确性。联合创始人兼CEO Diogo Almeida(前OpenAI研究员,参与过ChatGPT早期技术开发)有一个著名的比方:”如果一个系统在95%的情况下表现得像爱因斯坦,但另外5%的情况下却像憨豆先生,那么它对于自动化应用而言就完全没有价值。”
发布仅数天,Jev用户数量突破100万,目前约三分之一的《财富》美国500强企业已经使用Jev,每天处理的token数量达到数万亿。TypeSafe已计入相关费用后实现盈利。领投方a16z的普通合伙人Martin Casado将TypeSafe与Cursor类比:Cursor让开发者更容易编写软件,TypeSafe让开发者以更低成本构建更可靠的软件。
三、OpenAI:GPT-6.1 Sol、Decisions API与平台生态演进
OpenAI在10月的动作密集且务实。GPT-6.1 Sol完成迭代更新,ChatGPT向免费用户全面开放GPT-6模型,产品形态上新增智能UI,回复可直接展示图片、图表与交互按钮。ChatGPT周活用户已突破12亿,广告年化收入运行率达10亿美元。
更值得关注的是,OpenAI正式推出**Decisions API**——这是对决策模型赛道的官方回应。LangSmith LLM Gateway现已支持OpenAI Decisions API,使Agent获得低延迟推理能力,并提供集中化控制,包括模型回退、数据脱敏策略和支出限额。决策模型通过LLM Gateway调用,返回结构化答案而非生成的聊天消息,端点为`/openai/v1/decisions`。
Jev爆火后,OpenAI、Meta、SpaceXAI等公司竞相推出成本更低的决策类模型。这不是巧合,而是一个明确的信号:**Agent的成本结构正在重构**——用低成本决策模型处理分类、路由等高频简单任务,高能力模型负责复杂规划与异常处理,这种分层执行框架有望将Agent完成有效任务的成本降低一个数量级以上。
四、Anthropic:Claude 5.5系列完成,成本革命与安全政策并重
Anthropic在9月发布Claude Opus 5.5(成本比Opus 5降40%)后,10月迅速完成Sonnet 5.5的发布,形成完整的5.5家族。Sonnet 5.5运行速度显著快于Sonnet 5,是Opus 5.5的低成本替代互补方案,定价为每百万输入token 2美元、输出10美元。
定价策略延续了Anthropic此前”明降暗升”的风格:Opus 5.5在保持顶级性能的同时大幅降低运行成本,Sonnet 5.5则以性价比面向企业级规模化部署场景。Anthropic正与Salesforce、贝恩、巴克莱等巨头深化合作,推动模型深入企业数据与业务流程。
在安全端,Anthropic于10月9日更新AI使用政策,**明确禁止利用Claude开发武器或使武器发挥作用**,并收紧监控与追踪相关规定。与此同时,Anthropic与埃森哲敲定150亿美元循环信贷协议,累计锁定14.8GW算力资源。据路透社报道,其IPO招股说明书预计已公开,路演正紧锣密鼓推进。
五、DeepSeek Harness开源爆火与国内融资潮
国庆假期,DeepSeek爆出大新闻:Harness团队(2026年3月组建)以MIT协议开源v0.1开发者预览版,**不到24小时在GitHub揽获7万颗星**。Harness是DeepSeek面向智能体(Agent)场景的执行框架,为各类LLM提供统一的”大脑-手脚”协同层。有意思的是,Harness不仅服务DeepSeek自家模型,也为竞品做”兼容层”——这是一个非常”平台化”的定位。
资金层面,国内融资同样热闹非凡:
- 阿里:完成约800亿港元配股融资,将核心资金投向AI基础设施与模型能力追赶
- 智谱AI:完成约50亿美元融资,将年末ARR目标由24亿美元上调至30亿美元
- 腾讯:加大海外算力采购,支撑海外业务的模型能力
- MiniMax:披露7月Token消耗量达到1月的20倍,显示用户粘性快速提升
在开源榜单上,lmarena.ai最新排名显示前4名全部来自中国——智谱GLM-4.7、月之暗面Kimi-K2-Thinking-Turbo、DeepSeek、阿里Qwen 3 Coder 480B。外媒点评”开源模型前15名全部是中国模型”,这与9月篇提到的”中国开源引领架构创新”形成连贯叙事。
六、定价革命:决策模型正在重塑AI成本结构
10月最重要的定价信号,不是某家模型降了百分之几,而是**决策模型赛道的出现正在重新定义”AI算力”的含义**。Jev以$0.042/百万token的输入价格和免费输出,彻底击穿了闭源模型的定价天花板。
我们来对比一下当前主要模型的定价结构:
| 模型类型 | 代表产品 | 输入价格(/百万token) | 输出价格(/百万token) | 定位 |
|---|---|---|---|---|
| 旗舰闭源 | Claude Opus 5.5 | $5.00 | $25.00 | 复杂推理、科研 |
| 旗舰闭源(降本版) | Claude Sonnet 5.5 | $2.00 | $10.00 | 企业级规模化 |
| 主力闭源 | GPT-6.1 Sol | $2.50 | $10.00 | 通用Agent |
| 旗舰开源 | GLM-5.3-Flash | 0.5元 | 2元 | 本地部署、企业 |
| 主力开源 | DeepSeek V4 Flash | 0.5元 | 2元 | 通用场景 |
| 决策模型 | Jev | $0.042 | 免费 | 分类、路由、评分 |
决策模型的定价与传统LLM完全不在一个量级。在Agent工作流中,假设100个步骤里有90个可以用决策模型处理,10个需要旗舰模型介入——总成本可能只有原来的五分之一甚至更低。这就是为什么TypeSafe虽然还在早期阶段,却已经能说服a16z和红杉抢着投钱。
七、行业趋势与信号
趋势一:决策模型(Decision Models)正式成为新赛道
Jev的爆火和OpenAI Decisions API的推出,标志着决策模型从”小众实验”变成”产业共识”。这类模型不聊天、不写代码,专门处理分类、路由、评分、动作选择等结构化决策任务,以超低延迟和超低成本成为Agent架构中的”齿轮层”。TypeSafe称之为System One Models(快思考),传统LLM则是System Two(慢思考)。
趋势二:旗舰模型开放策略转向”受控测试”
Google Gemini 4 Argon只给安全团队、ChatGPT的GPT-6 Astra有循环深度争议后更新行为失准披露框架、Anthropic IPO前加速收紧安全政策——大厂旗舰模型的开放策略已从”尽快推给所有人”转向”先做受控测试”。这不是竞争放缓,而是安全护栏的建设速度跟不上模型能力增长速度的必然结果。
趋势三:Agent商业化从企业部署向消费端延伸
ChatGPT广告年化收入运行率达10亿美元,MiniMax 7月Token消耗量为1月的20倍,智谱上调年末ARR目标至30亿美元——Agent的商业化正在从”企业批量采购”向”消费端高频使用”延伸。下一轮收入增量更多来自Agent使用深度提升,稳定交付、留存和付费转化是竞争关键。
趋势四:AI4S(AI for Science)成为战略高地
Claude科研实验、微软Quine、罗氏自主实验室建设——头部AI公司正加速连接AI模型与科学发现流程。晶泰上半年AI4S解决方案收入同比增长136.4%,英矽智能授权合作与临床推进提供产业验证。随着候选生成能力提升,具备专业模型、科研Agent和实验交付能力的平台有望持续受益。
结语
如果说9月的主题是”超级发布周”和”架构创新”,那么10月的主题就是**”新赛道崛起”和”谨慎开放”**。
Jev以”不聊天、不写代码”的差异化路线迅速崛起,8.7亿美元的融资速度和75亿美元的估值,证明了市场对”可靠、低成本决策”的迫切需求。OpenAI Decisions API的跟进,则标志着决策模型赛道已从”黑马”变成”竞技场”。
与此同时,Google、Anthropic等头部厂商的旗舰模型开放策略变得前所未有的谨慎。Gemini 4 Argon只给安全团队做Fairwind受控测试,Anthropic IPO前加速收紧安全政策——当模型能力指数级增长时,安全护栏的建设速度正在成为制约旗舰模型”全面开放”的核心瓶颈。
对于开发者和企业来说,10月给出的信号是清晰的:**不要在”聊天模型”这一个篮子里放所有鸡蛋**。决策模型可以帮你节省90%的Agent成本,开源模型可以帮你摆脱对高价闭源产品的依赖,而安全护栏则是所有模型部署的前提条件。这不是一个”比谁的模型更强”的时代,而是一个”比谁的Agent成本更低、交付更稳、边界更清”的时代。
