Google DeepMind与新加坡政府启动国家AI合作伙伴关系
Google DeepMind与新加坡政府启动新的国家AI合作伙伴关系,并在新加坡推出医疗、生命科学、教育、科研、可持续发展和AI安全项目。合作方预计通过加速研发,到2040年创造额外S$ 3.3 billion(US$2.5 billion)的经济价值。
推荐理由:文章梳理了Google DeepMind与新加坡政府合作落地的医疗、教育、科研和安全项目,呈现国家级AI应用的具体路径。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google DeepMind与新加坡政府启动新的国家AI合作伙伴关系,并在新加坡推出医疗、生命科学、教育、科研、可持续发展和AI安全项目。合作方预计通过加速研发,到2040年创造额外S$ 3.3 billion(US$2.5 billion)的经济价值。
推荐理由:文章梳理了Google DeepMind与新加坡政府合作落地的医疗、教育、科研和安全项目,呈现国家级AI应用的具体路径。
Google DeepMind 发布 Gemini 3.5 系列并首先推出 Gemini 3.5 Flash,定位为面向智能体和编码的高速模型。
推荐理由:文章同时交代 Gemini 3.5 Flash 在智能体、编码和多模态基准上的具体表现,以及面向个人、开发者和企业的开放入口,便于理解其应用范围。
Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。
推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。
Google Research 宣布,Google Photos 已在 Auto frame 中提供自动重构照片视角的功能。该功能先估计 3D 点图和相机参数,再用生成式 latent diffusion model 补全新视角下原本未拍到的区域,并自动调整人像构图、缓解广角自拍的透视畸变。符合条件的含人物照片可在 Auto frame 候选中获取重构后的第二个版本。
推荐理由:Google Photos 的 Auto frame 将 3D 场景重建与生成式修补结合,用于自动调整人像视角,呈现生成式编辑从裁剪到视角重构的变化。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。
推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks,将自然语言直接转化为 physics-aware Android XR 应用,生成时间可低于 60 seconds。
推荐理由:文章展示了 Gemini 与 XR Blocks 如何把自然语言转成 physics-aware Android XR 应用,并介绍 VCXR60、Pro Mode 和 11 次迭代带来的评测线索。
Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。
推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。
Google Research介绍AIMS研究的两项Nature Cancer研究,评估AI乳腺癌检测系统的独立表现及其作为第二阅片者融入NHS流程的可行性。独立评估中,整体癌症检出率从每千名女性7.54升至9.33,AI识别出原双读流程漏掉的25%间隔癌。阅片者研究显示,AI工作流与传统双人阅片在敏感性和特异性上具有非劣效性,并估计可减少46%的人工阅片量和36–44%的阅片时间。
推荐理由:文章将大规模回顾性评估、真实临床部署与阅片者研究放在一起,呈现AI提高检出率并降低阅片负担时的流程条件与协作难点。
Mistral AI 发布 Mistral Small 4,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到单一模型,并支持可配置的 reasoning_effort。
推荐理由:Mistral Small 4 将推理、多模态和智能体编码能力整合到单一模型,并给出性能、部署与开源许可信息,便于评估实际采用成本。
Mistral AI 发布 Mistral Small 4,并作为创始成员加入 NVIDIA Nemotron Coalition。Mistral AI 与 NVIDIA 计划结合模型架构、计算资源、开发工具和合成数据管线,共同开发开放的前沿 AI 模型。联盟首项计划是在 NVIDIA DGX Cloud 上训练基础模型,为即将推出的 NVIDIA Nemotron 4 家族提供开放基础。
推荐理由:材料把 Mistral AI 的模型发布与 NVIDIA Nemotron Coalition 的合作安排放在一起,交代了开放模型共建的参与方式和后续方向。
Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上相较 Mistral OCR 2 的整体胜率为 74%。
推荐理由:原文同时给出跨文档类型的对比结果、API 与可视化入口及按页计价,便于评估 OCR 接入企业流程的成本与适用场景。
Mistral AI 发布 Mistral 3,包含 14B、8B、3B 三个小型 dense 模型,以及采用稀疏 MoE、拥有 41B active 和 675B total 参数的 Mistral Large 3,全部采用 Apache 2.0 许可。
推荐理由:这次发布同时覆盖端侧小模型与大规模 MoE 模型,并给出开源许可、部署格式和多家平台入口,便于比较不同规模模型的使用路径。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 生产版本和 3B 本地与端侧版本。两者均以 Apache 2.0 许可发布,支持 32k token 上下文、长音频转写与理解、语音问答、摘要、多语言处理和函数调用。Voxtral 也通过 API 提供服务,定价从 $0.001 per minute 起。
推荐理由:Voxtral同时提供可本地部署的开源模型与API,并把长音频理解、问答摘要和语音函数调用纳入同一系统,便于比较开放部署与商业接口的取舍。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、较低成本和简化部署的企业级模型。模型在基准测试中达到或超过 Claude Sonnet 3.7 的 90%,价格为 $0.4 input / $2 output per M token,并支持四个 GPU 及以上的自托管环境。
推荐理由:原文将 Mistral Medium 3 与 Claude Sonnet 3.7、Llama 4 Maverick 等模型放在性能和成本维度比较,并说明了企业部署与定制路径。
Mistral AI 发布 Mistral Small 3.1,改进文本性能和多模态理解,将上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second。
推荐理由:这次更新同时覆盖文本、多模态和长上下文,并提供 Apache 2.0 许可与基础模型,便于评估其在端侧和定制场景中的适用性。
Mistral AI 发布 Mistral OCR,一款可处理图片和 PDF 的 OCR API,能提取文本、图片、表格和公式并保持交错顺序。API mistral-ocr-latest 已在 la Plateforme 提供,定价为 1000 pages / $,batch inference 下每美元处理页数约翻倍。
推荐理由:Mistral OCR 将复杂文档中的文本、图片、表格和公式统一提取,并支持结构化输出与自托管,适合评估多模态文档进入 RAG 和智能体流程的方式。