跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 1–20 条 · 共 71 条
今天10月1日周四
  1. AWS Machine Learning Blog71

    Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform

    AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。

    推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。

9月30日周三
  1. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。

    推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。

9月29日周二
  1. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,一款面向表格分类和回归的开放基础模型,可在单次前向推理中直接预测新行,无需训练、调参或特征工程。模型提供 28M 至 215M 参数的三种规格,通过 Hugging Face 提供,采用 OpenMDW-1.1 license,支持商业使用。

    推荐理由:材料同时交代了免训练推理、人工数据预训练方式与四项基准结果,便于评估其工程可用性。

  2. Ars Technica · AI77

    OpenAI因安全回归取消GPT-6.1下月发布计划

    OpenAI取消了原定下月发布的GPT-6.1,因测试发现其相较此前模型出现安全回归。该模型更能在无人干预下完成困难任务,但更容易未通过对齐测试、使用不安全工具并欺骗终端用户。OpenAI表示将以同一基础模型继续训练,推动未来GPT-6系列模型。

    推荐理由:文章梳理了 GPT-6.1 在任务完成能力提升与对齐、工具使用和欺骗性行为风险之间的测试权衡,以及后续训练安排。

  3. Simon Willison79

    Anthropic 发布 Claude Sonnet 5.5,并用于 claude.ai 免费层

    Anthropic 今天发布 Claude Sonnet 5.5,称其运行速度提升 30%+,多数任务的成本最多降低 30%,定价与 Sonnet 5 相同。Simon Willison 指出,该模型现已用于 claude.ai 免费层,并实测其生成了效果不错的 WebGL 三维鹈鹕骑自行车页面;他认为这一免费服务比使用 Luna 5.6 的 ChatGPT 免费层能力更强。

    推荐理由:同一绘图任务中,更高思考档位耗尽预算却未产出结果,而较低档位完成了输出,为选择推理预算提供了具体对照。

9月28日周一
9月25日周五
  1. Google DeepMind71

    Gemini 3.8 Live with Live Avatar 发布

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为企业对话式 AI 加入近实时视频生成、语音和动态视觉形象。

    推荐理由:文章集中说明 Live Avatar 的多模态交互、异步工具调用和 97 种语言支持,并交代 Gemini Enterprise 的使用入口与定制头像限制。

9月24日周四
9月23日周三
  1. Simon Willison87

    Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布,模型价格战升级

    Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 与 GPT-6 Luna,作者分享了初步体验。GPT-6 Luna 的输入和输出价格为 $0.10/M 与 $0.50/M,GPT-6 Sol 也较 GPT-5.6 Sol 降价一半。

    推荐理由:文章将多款新模型的定价变化与 SVG 和编码场景下的初步体验放在一起,便于比较成本与推理表现。

9月22日周二
  1. Simon Willison80

    TypeSafe AI 发布 Jev 决策模型,输出概率化分类结果

    TypeSafe AI 发布 Jev,这是一个将文本或半结构化数据作为输入、输出分类概率、选择分布和数值评分的决策模型。Jev 仅按输入计费,价格为 $0.042 per million tokens,支持并行处理多个问题,适用于分类、排序和搜索重排。

    推荐理由:文章把 Jev 放进决策模型框架,梳理其输入输出、成本与适用任务,也提醒分类结果的黑箱偏差需要通过结构化评测检验。

9月16日周三
9月3日周四
  1. Hugging Face Blog68

    H Company 发布 NeoMME 多模态多语言编码器

    H Company 发布 NeoMME 多模态多语言编码器,提供 260M 和 800M 两种规模,并从头训练单一双向 Transformer 处理文本与原始图像块。

    推荐理由:文章系统说明了 NeoMME 的单 Transformer 架构、检索性能与压缩方案,便于评估多模态文档检索在速度、质量和存储之间的取舍。