跳到正文

#模型发布

今日 2 条
6月30日周二
  1. Google Research69

    Google Research 发布 TabFM,用于表格数据零样本分类与回归

    Google Research 发布表格基础模型 TabFM,通过上下文学习对未见过的表格进行分类与回归,无需针对新任务训练模型或调参。模型完全使用数亿个合成数据集训练,结合行列交替注意力、行压缩与 Transformer 架构,标准配置通过单次前向传播生成预测,另提供加入交叉特征、SVD 特征的 32 路集成配置 TabFM-Ensemble。

    推荐理由:把表格预测改为上下文学习,为减少逐数据集训练和调参提供了不同路径,文中还区分了直接预测与加入特征工程的集成配置。

6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4:支持 170 种语言,新增边界框、块分类与置信度

    Mistral 发布文档理解模型 Mistral OCR 4,在提取文本的同时返回边界框、块类型及逐页、逐词置信度,支持 10 个语言组的 170 种语言。官方报告其在人类盲评中的平均胜率为 72%,OlmOCRBench 得分为 85.20,同时说明自动基准存在标注与格式匹配局限,竞品分数来自内部复现。

    推荐理由:边界框、块类型和置信度让文档提取结果能同时用于定位引用与安排人工核验,为检索和智能体流程提供更明确的输入结构。

6月11日周四
6月9日周二
  1. Google DeepMind83

    Gemini 3.5 Live Translate 实现流畅自然的语音翻译

    Google 发布音频模型 Gemini 3.5 Live Translate,支持自动识别 70+ 种语言并进行近实时语音到语音翻译。模型持续生成译音,保留说话者的语调、节奏和音高,官方称整个会话中仅落后说话者几秒,所有生成音频均带有 SynthID 水印。

    推荐理由:相较于等待说话结束再翻译的系统,连续生成译音的方式把上下文质量与跟随延迟的取舍带入实时跨语言沟通。

  2. Google DeepMind79

    Google DeepMind 发布 Gemma 4 12B:统一、无编码器的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用统一的无编码器架构,将视觉与音频输入直接接入 LLM 主干,面向笔记本本地多模态智能体应用。官方称其标准基准表现接近 26B MoE 模型,总内存占用不到后者一半,可在配备 16GB 显存或统一内存的设备上运行,并配备 Multi-Token Prediction(MTP)草稿模型以降低延迟。

    推荐理由:无独立编码器的音视频处理路径与本地内存要求,为评估多模态智能体从大模型迁移到笔记本的资源取舍提供了具体参照。

5月22日周五
5月18日周一
5月16日周六
  1. Google DeepMind90

    Google DeepMind 发布 Gemini 3.5 系列,率先开放面向智能体与编码的 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,率先开放 3.5 Flash,面向复杂、长流程的智能体与编码任务。官方称其在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出 token 速度为其他前沿模型的 4 倍。

    推荐理由:官方将智能体与编码基准表现同输出速度、成本放在一起比较,为评估长流程任务中的性能与延迟取舍提供了具体参照。

4月16日周四
  1. Google DeepMind73

    Google 发布 Gemini 3.1 Flash TTS,以音频标签增强语音表达控制

    Google 发布文本转语音模型 Gemini 3.1 Flash TTS,新增音频标签,可通过文本中的自然语言指令精细控制声音风格、语速和表达方式。模型原生支持多说话人对话及超过 70 种语言,在 Artificial Analysis TTS 排行榜获得 1,211 Elo,所有生成音频均嵌入 SynthID 水印。

    推荐理由:音频标签把语气、语速和句中表达变化纳入文本输入控制,为多角色对话与本地化语音应用提供了更细粒度的创作方式。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。

    推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。

4月3日周五
3月24日周二
  1. Mistral AI73

    Mistral 发布 Voxtral TTS:4B 参数语音生成模型,支持 9 种语言

    Mistral 发布文本转语音模型 Voxtral TTS,以 4B 参数支持 9 种语言的情感表达语音生成及零样本跨语言声音适配。官方称,在输入 10 秒声音样本和 500 个字符的典型条件下,模型延迟为 70ms;其人类评估显示,自然度优于 ElevenLabs Flash v2.5,音频质量与 ElevenLabs v3 相当。

    推荐理由:原文将语音自然度的人类评估与具体输入条件下的延迟并列呈现,为企业权衡语音智能体的表达质量与响应速度提供了参考。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,整合推理、多模态与智能体编码能力

    Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。

    推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。

2月5日周四
12月17日周三
  1. Mistral AI66

    Mistral AI 发布 Mistral OCR 3,提升手写、扫描件与复杂表格识别能力

    Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上的整体胜率较 Mistral OCR 2 达到 74%。模型支持提取文本与嵌入图像,输出带 HTML 表格结构的 Markdown,价格为 $2 per 1,000 pages,Batch-API 提供 50% 折扣后为 $1 per 1,000 pages。

    推荐理由:对文档处理流程而言,表格结构保留、批量价格与向后兼容信息提供了具体依据,可用于评估升级成本和接入方式。

12月9日周二
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3,涵盖 Large 3 与 3B、8B、14B 小模型

    Mistral 发布 Mistral 3 系列,包括 3B、8B、14B 的 Ministral 3,以及激活参数为 41B、总参数为 675B 的混合专家模型 Mistral Large 3,均采用 Apache 2.0 许可证。

    推荐理由:从端侧稠密模型到大型混合专家模型均采用宽松许可证,并给出压缩格式与硬件部署条件,为不同资源预算下的模型选型提供参考。

7月30日周三
7月15日周二
7月11日周五
6月10日周二
5月28日周三
5月21日周三
  1. Mistral AI75

    Mistral AI 发布开源编码智能体模型 Devstral,SWE-Bench Verified 得分 46.8%

    Mistral AI 与 All Hands AI 合作推出软件工程智能体模型 Devstral,以 Apache 2.0 许可开放,定位为研究预览。模型针对真实 GitHub 问题训练,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 模型高出超过 6 个百分点,可通过 OpenHands 或 SWE-Agent 等框架处理代码库任务。

    推荐理由:同一智能体框架下的基准比较结合单卡运行条件,为评估开源编码模型在本地代码库中的部署取舍提供了具体参照。

5月7日周三
  1. Mistral AI71

    Mistral AI 发布 Mistral Medium 3,主打性能、成本与企业部署的平衡

    Mistral AI 发布 Mistral Medium 3,面向编码、多模态理解等企业场景,支持混合部署、本地部署及 in-VPC 部署。官方称其各项基准表现达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并可在至少 4 个 GPU 的自托管环境中部署。

    推荐理由:将基准表现、API 价格与自托管条件放在一起比较,为企业在模型能力、使用成本和部署方式之间取舍提供了具体参考。

3月17日周一
3月7日周五
  1. Mistral AI76

    Mistral 发布文档理解模型 Mistral OCR,API 定价为 1000 pages / $

    Mistral 发布 Mistral OCR 文档理解模型,可从图片和 PDF 中按顺序提取交错的文字与图像,处理表格、公式及复杂布局。其已成为 Le Chat 的默认文档理解模型,API mistral-ocr-latest 今日在 la Plateforme 开放,定价为 1000 pages / $,批量推理时每美元可处理的页数约翻倍。

    推荐理由:对需要处理复杂文档的检索系统,按顺序提取交错的文字与图像比单纯转录文本更有参考价值,也更贴近多模态资料的接入需求。