跳到正文

#编码

今日 3 条
今天10月1日周四
  1. AWS Machine Learning Blog71

    Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform

    AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。

    推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。

9月30日周三
  1. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。

    推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。

9月29日周二
  1. Simon Willison79

    Anthropic 发布 Claude Sonnet 5.5,并用于 claude.ai 免费层

    Anthropic 今天发布 Claude Sonnet 5.5,称其运行速度提升 30%+,多数任务的成本最多降低 30%,定价与 Sonnet 5 相同。Simon Willison 指出,该模型现已用于 claude.ai 免费层,并实测其生成了效果不错的 WebGL 三维鹈鹕骑自行车页面;他认为这一免费服务比使用 Luna 5.6 的 ChatGPT 免费层能力更强。

    推荐理由:同一绘图任务中,更高思考档位耗尽预算却未产出结果,而较低档位完成了输出,为选择推理预算提供了具体对照。

9月23日周三
9月9日周三
9月3日周四
8月25日周二
  1. Hugging Face Blog80

    Granite 4.2 推理模型家族如何构建

    IBM Granite Team 详解 Granite 4.2 推理模型家族的构建过程,涵盖 3B、8B 和 30B 三种规模,以及从 Granite-4.1 基础模型到 SFT 和多阶段 RL 的训练流程。

    推荐理由:文章梳理 Granite 4.2 从 Granite-4.1 基础模型、SFT 到多阶段 RL 的训练链路,并说明 8B 与 30B 如何在真实环境中通过 Agentic RL 学会工具操作。

8月14日周五
7月21日周二
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,分别面向通用智能体、低延迟高吞吐任务及网络安全。

    推荐理由:文章将三款模型的定位、速度与价格放在同一发布中说明,并交代 Gemini 3.5 Flash Cyber 的受限部署方式,便于比较不同智能体工作负载的选择。

7月17日周五
7月2日周四
5月22日周五
5月16日周六
3月17日周二
  1. Mistral AI81

    Mistral Small 4 发布,统一推理、多模态与智能体编码能力

    Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。

    推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。

12月9日周二
7月11日周五
5月28日周三
5月21日周三
5月7日周三
  1. Mistral AI78

    Mistral Medium 3 发布,主打低成本企业级性能

    Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、较低成本和简化部署的企业级模型。模型在基准测试中达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并支持四个 GPU 及以上的自托管环境。

    推荐理由:原文将 Mistral Medium 3 与 Claude Sonnet 3.7、Llama 4 Maverick 等模型放在性能和成本维度比较,并说明了企业部署与定制路径。