1 Star 0 Fork 2

jackfrued/spider2002

加入 Gitee
与超过 1200万 开发者一起发现、参与优秀开源项目,私有仓库也完全免费 :)
免费加入
文件
该仓库未声明开源许可证文件(LICENSE),使用请关注具体项目描述及其代码上游依赖。
克隆/下载
example01.py 635 Bytes
一键复制 编辑 原始数据 按行查看 历史
jackfrued 提交于 2020-09-01 15:12 . 爬虫课堂代码
import random
import re
import time
import requests
for page in range(1, 11):
resp = requests.get(
url=f'https://movie.douban.com/top250?start={(page - 1) * 25}',
headers={
'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.83 Safari/537.36',
}
)
pattern = re.compile(r'\<span class="title"\>(.*?)\<\/span\>')
results = pattern.findall(resp.text)
results = [result for result in results if not result.startswith('&nbsp;')]
for result in results:
print(result)
time.sleep(random.randint(1, 3))
马建仓 AI 助手
尝试更多
代码解读
代码找茬
代码优化
1
https://gitee.com/jackfrued/spider2002.git
git@gitee.com:jackfrued/spider2002.git
jackfrued
spider2002
spider2002
master

搜索帮助