OpenAI 发布 GPT-6.1 Sol,称性能接近 GPT-6 Astra、价格降至五分之一
OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。
OpenAI 在周二的 DevDay 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra,标准输入与输出 token 价格仅为后者的五分之一。
推荐理由:材料将接近高阶模型的性能主张与五分之一的价格并列,并给出事实错误率变化,为比较成本与能力取舍提供了具体依据。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和办公任务中以约五分之一成本接近 Astra,相关基准均为官方初步结果。
推荐理由:同价位模型的缓存价格与多步任务成本对照,为高频复用上下文的智能体工作流提供了比单看榜单分数更具体的选型依据。
Anthropic 发布 Claude Sonnet 5.5,定价与 Sonnet 5 相同,并称运行速度提升 30%+、多数任务成本最多降低 30%;该模型现已用于 claude.ai 免费层。
推荐理由:实测对比了不同思考强度下的生成结果与成本,展示了更高的思考预算不一定能换来可用输出这一具体问题。
AINews 因写作表现改善转用 Claude Opus 5.5;Anthropic 称其默认设置下每项任务较 Opus 5 便宜约 40%,OpenAI 同期发布的 GPT-6 Sol 和 Luna 则较各自 GPT-5.6 前代降价约 50%。
推荐理由:材料区分了标价下降与实际任务成本,并对照不同推理强度下的 token 消耗,为理解模型降价提供了更具体的比较口径。
Simon Willison 对 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 进行了初步实测,并比较了新模型降价后的使用成本。
推荐理由:价格对照与失败测试提供了模型选型的成本视角,单价下降之外,高推理档位耗尽输出额度的费用与等待时间也应纳入比较。
TypeSafe AI 上周推出 Jev,Simon Willison 解读了这种接收文本、返回分类概率或数值评分而非文本的“System One”决策模型。它支持是非、选项和评分三类问题,可并行评估多个问题,输入价格为 $0.042 per million tokens,输出免费。
TypeSafe 发布 Jev,以 RLCD 训练面向决策、分类、路由和评分的模型,而非自由文本生成模型。正文转述其速度提升 20–200x、成本降低 40–400x 且输出 token 免费的宣称,并介绍了并行采样与校准能力。Jev 需要预定义输出格式,不能生成自由文本,定位是结构化选择的推理引擎,而非通用 LLM 替代品。
NVIDIA CEO 黄仁勋在 Dreamforce 表示,AI 作为基础设施将让人们“知晓一切、做到任何事”,并强调创新速度与安全可以兼顾。同期公布的 Salesforce 首款 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 构建,已在内部运行,计划于 10 月进入客户试点。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
OpenAI 介绍 GPT-6 Astra,称其为旗下能力最强的商用模型。该模型具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。
Liquid AI 发布适配 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,实测 H100 上最高加速 3.18x,M4 Max 上最高加速 2.87x。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
Thinking Machines Lab 开放多模态模型 Inkling,并新增同架构的 Inkling-Small,原生接收图像、文本和音频输入。Inkling 总参数为 975B、激活参数为 41B,支持 1M 上下文窗口;Inkling-Small 总参数为 276B、激活参数为 12B,提供 MXFP8 和 NVFP4 权重。
推荐理由:不同精度版本的显存需求与部署配置并列呈现,为比较完整模型和小型版本的硬件门槛提供了具体依据。
Mistral 发布 Leanstral 1.5,这款面向 Lean 4 证明工程的模型总参数为 119B、激活参数为 6B,以 Apache-2.0 许可开放权重并提供免费 API。
推荐理由:从数学竞赛题到真实代码缺陷,材料给出了形式化验证的成本对比与工程案例,便于判断证明模型进入开发流程的实用价值。
Google Research 发布表格基础模型 TabFM,通过上下文学习对未见过的表格进行分类与回归,无需针对新任务训练模型或调参。模型完全使用数亿个合成数据集训练,结合行列交替注意力、行压缩与 Transformer 架构,标准配置通过单次前向传播生成预测,另提供加入交叉特征、SVD 特征的 32 路集成配置 TabFM-Ensemble。
推荐理由:把表格预测改为上下文学习,为减少逐数据集训练和调参提供了不同路径,文中还区分了直接预测与加入特征工程的集成配置。
Google Research 为冻结权重的 Gemini Nano v3 加装多 token 预测(MTP)头,相关加速方案已部署至 Pixel 9 和 10 系列。
Google DeepMind 发布实验性开放模型 DiffusionGemma,以 Apache 2.0 许可提供权重,在专用 GPU 上实现最高 4x 的文本生成速度。
推荐理由:本地低并发与高并发云端的收益差异交代清楚,能帮助开发者结合输出质量取舍判断文本扩散是否适合自己的工作负载。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。
推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。
Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。
推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库任务,以 Apache 2.0 许可开放权重,并接入 Mistral Vibe。
推荐理由:基于真实形式化仓库任务的评测同时列出得分与运行成本,为比较专用模型和通用编码智能体的证明工程取舍提供了依据。
Mistral 发布 Mistral 3 系列,包括 3B、8B、14B 的 Ministral 3,以及激活参数为 41B、总参数为 675B 的混合专家模型 Mistral Large 3,均采用 Apache 2.0 许可证。
推荐理由:从端侧稠密模型到大型混合专家模型均采用宽松许可证,并给出压缩格式与硬件部署条件,为不同资源预算下的模型选型提供参考。
Mistral AI 发布首款推理模型 Magistral,包括 24B 参数的 Small 开放权重版和 Medium 企业版,主打多语言、多步骤及可追溯推理。
推荐理由:开放权重与企业版本并行提供,并披露相同基准下的成绩和部署入口,为比较自部署与托管推理模型提供了具体依据。