llm 0.36 版本动态
Simon Willison 发布了题为“llm 0.36”的动态,正文未提供该版本的功能或变更详情。页面另附月度 LLM 简报订阅推广,价格为 $10/month,提供当月重要进展的精选邮件摘要。
Simon Willison 发布了题为“llm 0.36”的动态,正文未提供该版本的功能或变更详情。页面另附月度 LLM 简报订阅推广,价格为 $10/month,提供当月重要进展的精选邮件摘要。
Simon Willison 发布了题为“llm-anthropic 0.29”的动态。所提供的正文仅含作者、标签及订阅推广信息,未说明该版本的更新内容、功能变化或可用性。
Simon Willison 开发了 llm-typesafe 插件,为 LLM 添加对 TypeSafe AI 的 Jev 模型的支持。插件支持是非判断、按指定类别选择及按给定标准评分,安装后需配置 API 密钥,密钥申请设有候补名单。
NVIDIA 在 ROSCon 发布免费开源的 Isaac ROS 5.0,新增智能体开发工作流,并支持 ROS Lyrical 和 Ubuntu 24.04。
Hugging Face 为 Transformers 新增高效运行 GGUF 量化模型的支持,通过复用 ggml 内核并优化 generate,初期面向 Apple Silicon 本地推理。
Higgsfield AI 借助 GPT-6 Astra 在一天内推出新视频功能,加快创意工具面市。GPT-6 Astra 还让小企业更容易制作视频广告。
OpenAI Academy 新增面向员工、开发者、领导者、教育工作者和学生的学习路径。这些学习路径旨在帮助学习者培养并展示实用 AI 技能。
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。V7 使用 GPT-5.6 将分散的公司文件转化为 AI 智能体可用的上下文,支持其完成关联来源的复杂工作。
Hugging Face 实测 tokenizers v1 候选版,在 Apple M4 Max 上覆盖的 10 个模型家族中,单线程编码比 v0.23 快 3 至 30 倍,保持相同 token ID 输出。
Simon Willison 的 llm-keys-ui 0.1 插件提供保存 API 密钥的界面,避免直接把密钥粘贴到 ChatGPT 应用的智能体会话中。
Simon Willison 发布了一则标题为 datasette-explain 0.2.2 的动态。正文未提供该版本的功能、变更或可用性信息,仅附有主题标签和月度 LLM 简报订阅推广。
Google Research 分享生成式 UI 教育研究,让教师按课程和学习目标生成定制互动模拟,并提供超过 30 个英文 STEM 示例。生成流程结合教师审批的学习目标、递进关卡、分层提示与自动评估纠错,公开示例均经教师审核;美国初步研究中,12 名教师各请求了 3 个定制互动模拟,对质量的平均评分为 8/10。
Pawprint Studio 的免费开放世界生物捕捉角色扮演游戏《Aniimo》本周首发上线 GeForce NOW,可在支持的设备上云端游玩,无需下载 45GB 文件。本周共有 11 款游戏加入平台;《007 First Light》新增路径追踪,并由 NVIDIA DLSS 4.5 Ray Reconstruction 提升画面质量。
Cooley 利用 ChatGPT Work 构建 GO Public,将 AI 能力引入 IPO 流程,帮助律师加速相关工作。该工具帮助律师更早发现问题,将专业判断集中在最关键的环节。
OpenAI for Law 为法律工作提供前沿智能,支持定制律所工作流程并连接法律数据源。该产品还提供适用于保密客户工作的法律级管控措施。
OpenAI 探索由 AI 驱动的新广告体验,涵盖 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。这些探索聚焦 AI 在广告场景中的应用。
Hex 借助 GPT-6 Astra,让数据 AI 智能体将复杂分析的答案转化为可视化报告。这些报告以交互式可视化呈现结果,让员工乐于分享。
NVIDIA 介绍了 DSX 如何通过动态功率分配与整厂优化提高 AI 工厂产出,Lambda 的部署验证显示同一功率预算下 token 吞吐量提升 24%。在 HGX B200 集群上,DSX MaxLPS 让 19 个节点使用相当于 16 个全功率节点的预算,每瓦性能提升 23%。
ALTK-Evolve 新增 Consistency Analyzer 和一致性指南生成能力,在 AppWorld 测试中将 GPT-4.1 智能体的一致性差距从 24.4pp 缩小至 12.0pp。
推荐理由:通过区分平均成功率与多次运行全部成功的任务比例,这篇材料提供了衡量智能体重复执行可靠性的具体方法。
Perplexity 使用 GPT-6 Astra 处理端到端系统工作,相比使用早期模型时,检查频率显著降低。其具体用途包括撰写通信内容、修改软件和监控生产系统。
Cognition 借助 GPT‑6 Astra 提升 Devin 测试软件并展示其正常运行的能力,让 Devin 更好地验证自身工作成果。此举旨在帮助工程师减少代码审查量,交付更多软件。
OpenAI 在 ChatGPT Work 中推出 Data agent,支持用户用自然语言借助 AI 处理公司数据。用户可以连接公司数据、发现洞察并构建交互式仪表盘。
OpenAI 推出 ChatGPT for Financial Services,将内置金融数据与 GPT-6 Astra 相结合。该产品用于研究、建模,以及制作可交付客户的材料。
OpenAI 推出 Agents API,这是一项用于构建与上线云端智能体的托管服务。该服务由 Codex harness 驱动,支持编排、长时间运行的会话和工具使用。
推荐理由:托管服务将编排、长时间运行的会话和工具使用纳入同一入口,为构建与上线云端智能体提供了明确的工程路径。
Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组全部 9 billion 种单碱基变异的分子影响。配套的 AVI 评分整合 AlphaGenome 与 AlphaMissense 的预测,支持编码及非编码区域的变异排序,并通过特征归因解释相关分子过程;合作研究利用这些预测发现并实验验证了罕见病相关变异。
推荐理由:将全基因组变异预测与影响评分及特征归因连接起来,为研究者从候选变异排序走向分子机制解释提供了可迁移的研究路径。
OpenAI 推出 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像。生成结果能更好地体现用户的创意。
GitHub 推出 Project HydraFusion 研究预览,在 GitHub Copilot CLI 中按任务动态选择模型与执行流程,面向所有 Copilot 套餐开放。
推荐理由:三组离线评测同时列出质量差异与完整工作流成本,为比较多模型编排和单一强模型的质量成本取舍提供了具体依据。
Hugging Face 的开源工具 funes 将已有会话转为持久记忆,支持 Claude Code、Codex、pi 和 Hermes 跨智能体检索。嵌入与重排序在本机运行,检索返回原文及会话出处;用户可选择同步至自己拥有、默认私有的 Hugging Face 数据集,实现跨机器共享。
推荐理由:将会话原文连同出处保留为可检索数据,为跨智能体交接提供了不同于压缩摘要的路径,也让过去决策的依据能够被追溯。
Google 推出限量开放的 Fairwind Program,向可信的 Google Cloud 客户、政府机构和网络安全伙伴提供自主发现与修复漏洞的能力。该计划结合 Gemini 3.8 Flash Cyber 与 CodeMender,Google 称其可在组织的安全云环境中,将人工修复所需的数周缩短为数分钟,生成经过验证、可部署的补丁。
推荐理由:将漏洞发现、验证与修补放在同一流程中,提供了观察防御团队如何缩短修复周期并在受控云环境中应用智能体的具体案例。
Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。
推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。
Hugging Face 发布 @huggingface/kernels,可从 Hub 加载并运行优化的 WebGPU 内核,首批提供 207 个。内核采用 Apache-2.0 许可,附带版本化接口、正确性测试与基准用例。同步推出的 Fleet 可在浏览器中测试 GPU 性能与正确性,经用户同意收集结果以改进内核。
Google 在 Earth AI 中介绍实验性研究系统 planetary prediction engine(PPE),可从自然语言查询自动完成地理空间数据发现、整理、模型训练与评估。
推荐理由:研究将防止目标泄漏与过拟合的检查嵌入自动建模流程,为把智能体用于地理空间预测提供了可迁移的工程思路。
Gradio 内置的 gr.Workflow 可将 AI 流水线表示为带类型节点的图,并提供可拖拽、逐节点运行和查看中间结果的画布。节点可连接 Python 函数、Hugging Face Inference Providers 上的模型、Gradio Spaces 或数据集,文中通过图像编辑、并行生成和数据集分析等示例演示用法。
推荐理由:将中间结果可见的节点画布与同一工作流的接口调用结合,为多步骤 AI 应用提供了从排查问题到复用服务的具体方法。
Mistral 推出 Agentic Search,通过多步检索与文档导航帮助 AI 系统查找、阅读和核验复杂文档中的信息。它基于现有索引提供 search、open、navigate、read 和 grep 五种工具,可通过 Mistral Search Toolkit 集成,也已内置于 Studio 和 Vibe 的 Libraries,支持云端和本地部署。
推荐理由:通过区分单次检索、循环搜索和文档导航的评测结果,材料展示了复杂文档问答中准确率提升与检索开销下降之间的关系。
OlmoEarth Studio 现已支持按需计算并导出地球观测嵌入向量,用于相似性搜索、分割和无监督探索。用户可通过界面或 API 自定义区域、时间范围、编码器、分辨率及影像来源,获取 COG 文件。OlmoEarth 基础模型的源码与权重已公开,也可自行计算嵌入向量。
Mistral AI 加强推理的区域控制与可靠性,扩展第三方开放模型支持,并联合企业锁定欧洲长期算力。Mistral Regional Endpoints 已正式可用,支持选择欧洲或美国推理区域;平台将从 GLM-5.2 开始支持第三方开放模型。企业多年期承诺将通过 European Compute Units 换取基础设施使用权。
Baseten 已接入 Hugging Face Inference Providers,首批支持对话和文本生成任务。可用模型包括 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2,支持通过模型页面及 Python、JavaScript SDK 调用。经 HF 路由的请求按供应商标准 API 费率计费,不额外加价。
微软研究院推出开源框架 Orchard,通过可复用的 Orchard Env 环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。该服务基于 Kubernetes,可直接在 Codex、OpenClaw、ZeroClaw 等实际部署框架内训练智能体,并配套开放训练流程、数据和评估方法。
推荐理由:将运行环境独立为可复用服务,并在实际部署框架内训练智能体,为减少跨任务基础设施重复建设和训练部署差异提供了具体路径。
Diffusers 新增 Nunchaku Lite 原生支持,可通过 from_pretrained() 加载量化检查点,无需独立推理引擎或本地 CUDA 编译。
Pollen Robotics 发布开源低成本系统 Grabette,可用手持夹爪记录操作示范,无需机器人即可采集并自动转换为 LeRobot 数据集。Grabette 的物料成本约为 ~490€,配备双摄像头,支持通过浏览器处理数据、恢复 6-DoF 轨迹并上传至 Hugging Face Hub。