数据工程
核心认知:2026年大模型竞争 = 数据工程竞争。模型架构趋同,数据质量决定上限。
预训练数据关键技术
数据清洗:去低质网页/广告/模板页/垃圾文本
去重:MinHash+语义相似度,5-10%重复率即明显降低泛化
质量打分:分类器/规则/强模型筛选
数据配比:平衡代码/数学/通用文本/多语言/领域知识
课程学习:控制数据难度和训练顺序
专项能力数据
能力 | 数据类型 | 作用 |
数学 | 题目/证明/解题链/形式化证明 | 推理能力 |
代码 | 真实仓库/单元测试/issue/PR | 工程能力 |
科学 | 论文/实验记录/公式推导 | 知识深度 |
工具使用 | 搜索/浏览器/Shell/API操作轨迹 | Agent能力 |
合成数据:2025-2026后训练核心资产。流程:种子任务 → 强模型生成 → 自动过滤 → 验证器校验 → 人工抽检 → 入库。
关键不是"更多"而是"更难":生成难题样本
防风格坍缩和数据同质化
防只学"像答案"而非"会解题"
数据治理四底线
Benchmark泄漏:评测题混入训练集 → 虚高分数
版权风险:商业模型需明确数据授权边界
隐私泄露:个人信息/密钥/内部文档必须过滤
数据可追溯:来源/版本/过滤规则可审计
微调数据要点
1,000-10,000高质量样本即可
500条高质量 > 5000条低质量
合成数据需人工审核防幻觉注入
训练前必须做偏见审计
最佳实践:拆分先于清洗(防泄漏)、质量门禁嵌入管道(hard-fail)、分配数据Owner(问责制)。
