
各位读者好,今天是2026年9月19日,以下是今日AI行业要闻速览。
Anthropic与埃森哲合作开展前沿AI独立评估
Anthropic宣布与埃森哲合作,对其前沿AI模型开展独立评估。该合作由埃森哲旗下专业AI业务部门Faculty牵头,内容包括模型评估与红队测试、对齐评估以及模型防护措施测试。
双方计划在未来五年各投入至少10亿美元建设相关能力。该合作是Anthropic CEO在《We Must Pace the Frontier》一文中承诺将评估者嵌入公司内部的重要一步。嵌入式评估是一种新模式,评估者将在AI公司内部工作,拥有与员工相当的访问权限,可观察模型训练过程、跟踪构建与部署决策。
NVIDIA发布AIPerf,重写LLM基准测试工具
NVIDIA发布AIPerf,作为GenAI-Perf的官方继任者与彻底重写版本,旨在解决LLM基准测试中客户端自身成为瓶颈、结果不可信、工具配置耗时过长三大痛点。
AIPerf采用多进程架构:工作进程生成负载,独立记录处理服务处理结果,通过ZMQ协调,避免Python GIL限制。它支持15种以上端点类型,兼容ShareGPT等公共数据集及Mooncake、Baseten、WEKA trace回放格式,支持多种到达模式和突发配置。
英伟达展示GPT-6 Astra结合Omniverse构建物理AI实验
英伟达展示了开发者将OpenAI GPT-6 Astra与NVIDIA Omniverse库结合、构建物理AI应用的内部实验成果。Astra凭借编码、视觉推理和计算机使用能力协调多步骤工作流。
第一个实验利用Astra将NASA公开资产组装为国际空间站的OpenUSD模型,Blender负责转换与组装,Omniverse提供渲染、场景运行时和流式传输。第二个原型将立体RGB捕捉转化为可编辑仿真场景,涉及PyCuSFM、FoundationStereo、nvblox及Isaac Sim。
Artificial Analysis发布Coding Agent Index v1.5
Artificial Analysis推出编码智能体基准测试Coding Agent Index v1.5,用于衡量编码智能体在软件工程任务中的真实表现,涵盖成本、Token用量和执行时间。
该指数由三个基准等权复合而成:DeepSWE v1.1(113个软件工程任务)、Terminal-Bench 4.0(66个智能体终端使用任务)、SWE-Atlas-QnA(124个技术问答任务)。新增安全拒绝和奖励黑客指标,参与对比的模型来自Anthropic、OpenAI、Meta、DeepSeek、Google等共15个模型。
LangChain预告Jev模型:分类任务推理提速最高200倍
LangChain发布直播预告,将介绍由typesafeai推出的新模型Jev。据称,Jev在分类任务上相比同类LLM推理速度最高快200倍、成本低400倍,目标是解决agent循环缓慢且昂贵的问题。
如果Jev的性能得到验证,将为AI Agent的发展带来重要突破,显著降低分类任务的延迟和成本。
ChatGPT插件支持多账户连接
ChatGPT推出一项更新:用户现可在大多数插件中连接多个账户,将工作与个人账户的上下文带入同一对话。用户需在插件目录中连接账户。
对于开发者,该功能可自动生效,无需额外操作。多账户支持打破了工作与个人场景的壁垒,提升了AI助手的连贯性和实用性。
Paper2Agent在Nature发表:论文可转化为虚拟作者
James Zou宣布Paper2Agent于今日在Nature发表。科学知识传统上存储于被动论文中,Paper2Agent将论文转化为虚拟作者,能够回答问题、应用其方法,并与其他论文agent协作以产生新发现。
这一研究为科学知识的激活与再利用开辟了全新路径,有望显著加速科研创新的速度。
斯坦福HAI新教职系列首场:AI风险与规则制定
斯坦福HAI宣布推出新教职系列”Prompt Response”,首场活动讨论AI是否为生存风险、其发展速度能否放缓,以及由谁来制定规则。三位学者分别从政治哲学、系统内部和国家安全角度展开。
相关后续活动包括”世界模型”研讨会、AI加速引发社会焦虑会议以及AI扩散案例研究研讨会。
其他重要资讯
- MIT CSAIL科学任务分类法:映射跨研究子领域与部门的任务,展示科研工作与更广泛经济活动的差异,对AI影响科学的方式具有重要含义。
- 斯坦福AI指数2026:各国著名AI模型数量排名前三为美国59个、中国35个、韩国8个。
- Chris Manning访谈:大学应承担前沿AI独立评估角色,介绍Moonlake项目将基于代码的物理模拟与神经渲染相结合。
- YC S26批次数据:硬科技公司占比从8%升至20%,机器人从1%升至6%,工业制造从4%升至10%,反映孵化方向向硬科技倾斜。
- Databricks CEO谈AI:模型已足够聪明但缺乏组织内部上下文,不为存在性风险辩论失眠,失控起飞需多条件同时成立。
- PyTorch北美大会:将探讨Muon、TorchJD等新优化器如何与fastsafetensors、LMCache等工具协同,推动多损失效率提升和更快LLM服务。
- LangChain付费媒体Agent直播:9月23日现场演示其付费媒体智能体架构、工具、上下文与业务逻辑,分享生产环境经验教训。
以上就是今天的AI行业资讯速览,感谢阅读!如需了解更多AI行业动态,欢迎持续关注我们的频道。
