1 Star 0 Fork 2

jackfrued/spider2002

加入 Gitee
与超过 1200万 开发者一起发现、参与优秀开源项目,私有仓库也完全免费 :)
免费加入
文件
该仓库未声明开源许可证文件(LICENSE),使用请关注具体项目描述及其代码上游依赖。
克隆/下载
example02.py 567 Bytes
一键复制 编辑 原始数据 按行查看 历史
jackfrued 提交于 2020-09-01 15:12 . 爬虫课堂代码
import random
import time
import bs4
import requests
for page in range(1, 11):
resp = requests.get(
url=f'https://movie.douban.com/top250?start={(page - 1) * 25}',
headers={
'User-Agent': 'BaiduSpider',
}
)
# 基于页面的HTML代码创建BeautifulSoup对象
soup = bs4.BeautifulSoup(resp.text, 'lxml')
# CSS选择器解析 ---> BeautifulSoup4 / PyQuery
spans = soup.select('div.info > div.hd > a > span:nth-child(1)')
for span in spans:
print(span.text)
time.sleep(random.randint(1, 3))
马建仓 AI 助手
尝试更多
代码解读
代码找茬
代码优化
1
https://gitee.com/jackfrued/spider2002.git
git@gitee.com:jackfrued/spider2002.git
jackfrued
spider2002
spider2002
master

搜索帮助