网络爬虫采集教学

学习如何利用爬虫技术,从互联网获取自定义专属数据,为AI项目提供高质量的数据源

适用场景

自定义文本语料

采集特定领域的文本数据,用于训练NLP模型

行业评论

收集用户评论数据,进行情感分析和产品改进

场景图片

爬取特定场景的图片,用于计算机视觉训练

业务专属数据

获取与特定业务相关的结构化数据

核心工具

Requests

简洁优雅的HTTP请求库,用于发送请求获取网页内容

BeautifulSoup

HTML/XML解析库,用于从网页中提取数据

Selenium

自动化测试工具,用于处理动态加载的网页内容

Scrapy

专业的爬虫框架,用于构建大规模、高性能的爬虫项目

采集原则

合规采集

代码必须添加 time.sleep() 请求延时,避免短时间大量请求压垮对方服务器;设置合理的 User-Agent,不要伪装成浏览器恶意高频爬取。

规避版权

不采集受版权保护的内容,避免法律风险

过滤水印

对采集到的图片进行处理,去除水印等干扰信息

过滤无效数据

清洗和预处理数据,去除重复、错误的信息

合规与工程注意事项

  • 仅用于课程学习、学术研究,禁止商用、大规模高频抓取
  • 代码必须添加请求延时(time.sleep()),避免造成服务器压力
  • 禁止爬取隐私信息、付费内容、版权保护内容
  • 爬取得到的数据属于raw 原始数据,后续必须进入【数据清洗→标注→质检】流程
  • 遇到动态加载网页(JS 渲染),requests 无法获取内容,需要切换 Selenium
  • 优先选用官方专门给爬虫练习设计的测试站点

推荐爬取网站

一、爬虫练习专用测试网站

首选!无反爬、专为学习设计,适合直接跑 requests + BeautifulSoup 文本爬虫代码

网站 说明 链接
Books to Scrape 图书静态网页,分页练习 https://books.toscrape.com
Quotes to Scrape 名人语录,文本采集 https://quotes.toscrape.com
Scrape Center 多场景测试站点,电影数据 https://scrape.center
优势:没有反爬、不限速、专门开放给爬虫学习者,不会封 IP,最安全!

二、英文文本数据集采集网站

NLP 项目,构建文本分类、情感分析数据集

网站 说明 链接
Project Gutenberg 公版免费英文书籍,大量长文本 https://www.gutenberg.org
Wikipedia 英文 英文维基百科 https://en.wikipedia.org
Wikiquote 名人语录库 https://en.wikiquote.org

三、中文公开文本网站

构建中文 NLP 数据集,新闻、科普文本

建议调低抓取速度,增加 2~4 秒延时
网站 说明 链接
维基百科(中文) 中文百科文本 https://zh.wikipedia.org

四、图片爬虫站点

CV 图像分类项目素材,CC0 无版权图片,适合训练数据集,可搭配图片下载函数使用

网站 说明 链接
Lorem Picsum 随机占位图,首页有图 + /v2/list 返回 JSON 列表,双重爬取方式 https://picsum.photos/
LoremFlickr 按关键词随机图,直接返回 JPG 二进制,requests 保存即可 https://loremflickr.com/320/240/cat
PlaceBear 熊占位图(PlaceKitten 替代品),纯 CDN 直接返回图片 https://placebear.com/
OldBook Illustrations 古籍插图,纯 HTML 页面 img src 直接在 DOM 里,无反爬 https://oldbookillustrations.com/

五、结构化数据网站

适合机器学习表格数据采集

网站 说明 链接
Letterboxd 影评社区,90KB 完整 HTML,poster-* / film-list 结构,BS4 直接爬取热门电影列表 https://letterboxd.com/films/popular/
豆瓣电影 Top250 练习,注意严格控速 https://movie.douban.com/top250

交互演示

输入目标网址或选择下方推荐站点,体验爬虫从发送请求到提取数据的完整流程(模拟演示,不会发送真实网络请求)

返回数据收集全方案