跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 21–35 条 · 共 35 条
7月6日周一
  1. Hugging Face Blog66

    PRX 第四部分:数据策略

    PRX 团队介绍了其图像生成模型的预训练数据流程:混合公共与内部数据集,使用 VLM 为图像生成长描述,并以 Lance 构建和探索数据、以 Mosaic Data Shards(MDS)供训练流式读取。团队在数亿级数据上采用 JPEG quality 92、分辨率与宽高比分桶、基于 caption 的过滤和感知哈希去重,并选择 Qwen3-VL-8B 作为 captioner。

    推荐理由:文章把 PRX 的大规模图像训练数据流程拆成可复用环节,覆盖数据探索、VLM 重标注、格式转换、过滤去重及工程取舍。

6月30日周二
  1. Google Research70

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,这一面向表格数据分类和回归的基础模型可通过单次前向传播生成预测,无需手动训练、超参数调优或复杂特征工程。TabFM 采用交替行列注意力、行压缩和 Transformer,并基于数亿个合成数据集训练。

    推荐理由:文章解释了 TabFM 如何用交替行列注意力、行压缩和合成数据训练,将表格分类与回归转为零样本推理,并给出 BigQuery 使用入口。

6月25日周四
6月17日周三
  1. Google Research62

    Google Earth AI 将 Farmscapes 2020 转为自然恢复矢量数据

    Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率地图转化为包含树篱、石墙和小型林地的可操作清单。该框架使用在 300 million 全球卫星图像上预训练的 Remote Sensing Foundations Vision Transformer,并结合亚米级影像和 1-meter LiDAR 数据识别复杂农田景观。

    推荐理由:文章展示了如何将高分辨率卫星影像与 LiDAR 数据转化为可用于生态恢复和碳核算的精细化地理数据。

6月11日周四
  1. Google Research64

    Google Research 提出机器遗忘审计新框架

    Google Research 提出 Regularized f-Divergence Kernel Tests,用相对三样本检验审计差分隐私与机器遗忘。该框架在 SVT3 隐私违规检测中仅用几千个样本,而 DP-Auditorium 需要数百万个样本才能达到相近的检测率。对所评估的近似机器遗忘方法,只有 random label technique 通过了测试,作者同时说明实验使用了简化实现。

    推荐理由:文章把机器遗忘审计从直接比较两模型改为相对三样本检验,并展示其在隐私审计中减少样本需求、识别局部偏移的具体效果。

5月17日周日
  1. Google DeepMind72

    Google DeepMind 推出 Gemini for Science 科学工具与 Science Skills

    Google DeepMind 推出 Gemini for Science,包含 Google Labs 上的三款科学实验工具和 Google Antigravity 中的 Science Skills。三款工具分别用于假设生成、计算发现和文献分析,并将逐步开放注册。Science Skills 集成超过 30 个生命科学数据库和工具,可支持结构生物信息学与基因组分析等工作流。

    推荐理由:原文同时梳理了三类实验工具、Science Skills及其科研应用场景,便于了解Google如何把智能体能力接入假设生成、计算实验和文献分析。

5月16日周六
  1. Google DeepMind68

    WeatherNext 如何帮助美国国家飓风中心提前预测 Melissa 飓风登陆牙买加

    Google DeepMind 的 WeatherNext 帮助美国国家飓风中心提前 5 天预测 Melissa 飓风将以 Category 5 强度登陆牙买加。WeatherNext 可运行 50 个不同的情景,在登陆前 5 天以 80% 置信度预测这一结果,提前 3 天时置信度接近 100%。

    推荐理由:文章展示了 WeatherNext 如何通过 50 个情景集合同时预测飓风路径与强度,并为牙买加疏散和资源调度争取提前量。

4月22日周三
4月16日周四
4月9日周四
  1. Google Research64

    ConvApparel:Google Research 评估并缩小用户模拟器的真实性差距

    Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。

    推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。

4月1日周三
  1. Google Research60

    Google Research 研究 AI 基准中每项需要多少名评测者

    Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。

    推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。

3月17日周二
  1. Mistral AI67

    Mistral AI 发布 Mistral Small 4 并加入 NVIDIA Nemotron Coalition

    Mistral AI 发布 Mistral Small 4,并作为创始成员加入 NVIDIA Nemotron Coalition。Mistral AI 与 NVIDIA 计划结合模型架构、计算资源、开发工具和合成数据管线,共同开发开放的前沿 AI 模型。联盟首项计划是在 NVIDIA DGX Cloud 上训练基础模型,为即将推出的 NVIDIA Nemotron 4 家族提供开放基础。

    推荐理由:材料把 Mistral AI 的模型发布与 NVIDIA Nemotron Coalition 的合作安排放在一起,交代了开放模型共建的参与方式和后续方向。

3月12日周四
  1. Google Research77

    Google 以 AI 驱动的突发洪水预报保护城市

    Google 宣布在 Flood Hub 推出城市突发洪水预报,可提前最多 24 小时预测风险,将覆盖范围从河流洪水扩展至城市突发洪水。团队使用 Gemini 从公开新闻中提取洪灾发生地点和时间,构建 Groundsource 数据集,用于训练和评估结合天气、地理及城市化特征的 LSTM 模型。

    推荐理由:利用新闻报道重建历史洪灾样本,为缺乏传感器记录的地区提供了训练数据,也展示了非结构化资料转化为预测依据的方法。

  2. Google Research79

    Google Research 推出 Groundsource,构建2.6 million条城市山洪历史记录

    Google Research 推出 Groundsource,利用Gemini从80种语言的新闻报道中提取并核验山洪事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。该开放数据集可用于城市山洪建模与预测,Google还在Flood Hub中推出最长提前24小时的近全球城市山洪预报。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度。

    推荐理由:Groundsource展示了如何用Gemini把分散的新闻报道整理为可验证的灾害历史数据,并连接到山洪预测等实际应用。

7月23日周三