开始AI项目之前,确保你的工具箱已经准备就绪
8大阶段,环环相扣,完整呈现从想法到上线的全过程
规范的目录结构是可维护项目的基础
# 原始数据 ├── data/ │ ├── raw/ # 原始采集数据 │ ├── processed/ # 清洗后数据 │ ├── interim/ # 中间处理结果 │ └── external/ # 外部数据源 # 代码目录 ├── src/ │ ├── data/ # 数据处理代码 │ ├── features/ # 特征工程 │ ├── models/ # 模型定义 │ ├── training/ # 训练脚本 │ ├── evaluation/ # 评估代码 │ └── utils/ # 工具函数 # 模型与结果 ├── models/ │ ├── checkpoints/ # 训练检查点 │ └── final/ # 最终模型 ├── outputs/ │ ├── figures/ # 可视化图表 │ └── reports/ # 评估报告 # 配置与文档 ├── configs/ # 配置文件 ├── notebooks/ # Jupyter笔记本 ├── tests/ # 单元测试 ├── requirements.txt └── README.md
raw/ 保存原始数据不可修改,processed/ 存放清洗后的数据版本,interim/ 记录中间处理步骤便于回溯
按功能分层:数据处理、特征工程、模型定义、训练、评估,每个模块独立可测试
checkpoints/ 保存训练中的检查点便于恢复,final/ 存放经过验证的最佳模型
所有图表、报告、评估结果统一存放,方便项目汇报和经验沉淀
4大数据来源,覆盖从低成本到高定制化的各种场景
零成本、高权威性、快速验证。适用于算法原型验证、学习研究场景
定制化数据获取,目标网站定向采集。适用于特定业务场景的数据需求
真实场景数据,高质量标注。适用于工业检测、医疗影像等专业领域
快速扩充数据集,解决样本不均衡。适用于数据量不足、敏感数据脱敏场景
高质量标注是监督学习的基石,选对标注方式事半功倍
为每条样本打一个或多个类别标签
用矩形框标出目标 + 分类
逐像素标记类别,像素级精度
为句子中每个词打标签(NER等)
数据质量决定模型上限,清洗是AI项目的生命线
CSV / Excel / SQL
JPG / PNG / WEBP
TXT / JSON / HTML
从选模型到推理上线,AI 项目的核心闭环——训练→评估→调优→迭代
根据任务类型选合适架构(CV/NLP/表格)
前向传播→反向传播,loss 下降过程
准确率、F1、AUC、混淆矩阵
学习率、batch size、dropout、正则化
误差分析→发现问题→改数据/改模型
.pt/.h5/.pkl/checkpoint 格式选择
加载权重、恢复优化器状态、迁移学习
部署后接受输入、返回预测结果