NVIDIA Kumo Tabular 提升表格预测的准确率与效率
NVIDIA 发布开放表格基础模型 Kumo Tabular,利用带标签行作为上下文,单次前向传播即可完成分类或回归,无需针对任务训练、调参或特征工程。
推荐理由:相较每个任务重新训练的表格建模流程,上下文学习把带标签样本直接用于预测,为减少特征工程与调参提供了具体路径。
NVIDIA 发布开放表格基础模型 Kumo Tabular,利用带标签行作为上下文,单次前向传播即可完成分类或回归,无需针对任务训练、调参或特征工程。
推荐理由:相较每个任务重新训练的表格建模流程,上下文学习把带标签样本直接用于预测,为减少特征工程与调参提供了具体路径。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
Runway 的 GWM Worlds 2 研究预览通过 WorldPrompt 指定生成世界、首帧和带时间戳的事件,并支持实时输入动作提示词。团队在采访中解释,其音视频模型经过格式微调、自回归后训练和知识蒸馏,实现连续 720p、24 fps 视频与 48,000 Hz 音频生成。
小米发布原生全模态 MiMo-V2.6-Pro 和 Flash,其中 Pro 以 46 分登顶 Artificial Analysis Intelligence Index 开放权重模型榜。
推荐理由:模型权重之外,公开的强化学习环境与训练配方提供了更具体的技术参照,有助于理解后训练投入与能力提升之间的关系。
TypeSafe 发布 Jev,以 RLCD 训练面向决策、分类、路由和评分的模型,而非自由文本生成模型。正文转述其速度提升 20–200x、成本降低 40–400x 且输出 token 免费的宣称,并介绍了并行采样与校准能力。Jev 需要预定义输出格式,不能生成自由文本,定位是结构化选择的推理引擎,而非通用 LLM 替代品。
NVIDIA CEO 黄仁勋在 Dreamforce 表示,AI 作为基础设施将让人们“知晓一切、做到任何事”,并强调创新速度与安全可以兼顾。同期公布的 Salesforce 首款 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 构建,已在内部运行,计划于 10 月进入客户试点。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,接入实时卫星观测,每小时生成新预报,温度和湿度等关键地表变量分辨率达到 5-kilometer。
推荐理由:与前代相比,实时卫星观测和逐小时更新缩短了预报的信息滞后,更细的空间分辨率有助于理解局地天气变化与能源规划需求。
Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。
GigaPath-Flash 与 GigaTIME-Flash 通过知识蒸馏降低病理分析计算需求,支持更大患者队列的研究。GigaPath-Flash 在切片分类基准上与原模型得分差距不超过 3%,计算量约为其五十分之一。两款模型均以 Apache 2.0 许可开放,仅供研究,未经临床用途验证。
Google Research 构建了连续血糖监测基础模型 GlucoFM,以双流设计区分缓慢血糖趋势与短期波动,支持有限标注数据下的临床预测。在相同数据预训练的对比中,其在14项队列—任务评估中的平均 PR-AUC 为58.8,较最强 CGM 专用基线高4.1点。餐后血糖预测的跨设备平均绝对误差也最低。
Microsoft Research 扩大 Skala 的软件支持范围,现已在 CP2K 中可用,并正集成至 Psi4、FHI-aims、ORCA 和 VASP。Skala-1.1 在 GMTKN55 上的加权平均误差为 2.8 kcal/mol。团队还推出持续更新的基准,追踪后续版本的计算性能。
Google DeepMind 发布手语转文本模型 SL2T,为 Pixel 11 的 Gboard 和 Live Transcribe 提供 ASL 转英文输入功能。
推荐理由:将手语输入接入手机日常输入场景,让无障碍交互不再只依赖英文打字,同时通过仅上传身体坐标减少原始视频传输。
Microsoft Research 介绍胸部 X 光研究模型 CARE-X,结合报告生成、分类与定位辅助头及 DAPO 强化学习,在 ReXVQA 上达到 94% 总体准确率。
Google DeepMind 的 WeatherNext 在气旋路径、强度和风场结构预测中达到 SOTA 精度,平均三天预报可达到以往模型两天预报的准确度。发表于 Nature 的研究基于 2023 至 2024 年历史气旋进行评测,模型可在单个 TPU 上用不到一分钟生成一次 15 天预报,今年每个气旋的集合预测已扩展至 1,000 种可能情景。
推荐理由:以相同预报精度比较提前量,比单看误差更容易理解模型进步的实际意义,也为评估气旋预报工具提供了具体参照。
Mistral AI 发布 3B 多模态安全分类器 Shieldstral,以 Apache 2.0 开放权重,支持推理时用自然语言指定审核策略,无需重新训练。
推荐理由:将审核策略从固定类别改为推理时输入的自然语言问题,为不同产品调整安全边界提供了无需重新训练的部署路径。
NVIDIA 发布手术机器人生成式仿真模型 Cosmos-H-Dreams,通过知识蒸馏和 FlashDreams,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 帧/秒的闭环交互。
推荐理由:从离线轨迹生成转向实时闭环交互的技术路径,为理解手术机器人仿真如何同时降低生成成本与应对长序列误差提供了具体参考。
DharmaOCR 在专为葡萄牙语设计的基准测试中得分 0.925,优于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。其训练结合巴西葡萄牙语文档的监督微调与 DPO,分别强化领域能力和输出稳定性;团队三个月前已开源其中一个模型。
Mistral AI 发布机器人导航模型 Robostral Navigate,规模为 8B,仅凭单个 RGB 摄像头和自然语言指令即可执行导航任务,无需 LiDAR 或深度传感器。
Google Research 发布表格基础模型 TabFM,通过上下文学习对未见过的表格进行分类与回归,无需针对新任务训练模型或调参。模型完全使用数亿个合成数据集训练,结合行列交替注意力、行压缩与 Transformer 架构,标准配置通过单次前向传播生成预测,另提供加入交叉特征、SVD 特征的 32 路集成配置 TabFM-Ensemble。
推荐理由:把表格预测改为上下文学习,为减少逐数据集训练和调参提供了不同路径,文中还区分了直接预测与加入特征工程的集成配置。
Mistral AI 发布 Mistral Medium 3,面向编码、多模态理解等企业场景,支持混合部署、本地部署及 in-VPC 部署。官方称其各项基准表现达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并可在至少 4 个 GPU 的自托管环境中部署。
推荐理由:将基准表现、API 价格与自托管条件放在一起比较,为企业在模型能力、使用成本和部署方式之间取舍提供了具体参考。