想要一份国产电视剧的数据集来练手?不如直接爬一个。这次的目标是'全集网',它的电视剧列表页面结构清晰,翻页逻辑也直白——改个页码参数就行。最终我们会拿到剧名、评分和主演信息,输出一个 CSV 文件。整个过程覆盖了爬虫的基本环节:下载、提取和保存,代码也都会贴出来,可以直接跑。

打开全集网的国产电视剧分类,可以看到页面上已经显示了剧名、评分和主演,这正是我们需要的数据。地址栏的 URL 有个特点:第一页是 vodshow/13--------1---.html,点第二页后,URL 中间的 1 变成了 2。很明显,只要循环改变这个数字,就能访问所有页面。底部也是传统的翻页,没搞什么异步加载,这使得我们的爬虫不用去模拟 XHR,直接用 urllib3 请求即可。



下载网页
先写两个基础函数:一个下载网页,一个保存到文件。这里沿用之前用过的 urllib3,不引入新依赖。
import urllib3
def download_content(url):
http = urllib3.PoolManager()
response = http.request("GET", url)
response_data = response.data
html_content = response_data.decode()
return html_content
def save_to_file(filename, content):
fo = open(filename, "w", encoding="utf-8")
fo.write(content)
fo.close()
单个页面测试一下,下载第一页并保存为 tv1.html:
url = "https://www.fschurun.com/vodshow/13--------1---.html"
html_content = download_content(url)
save_to_file(, html_content)












