1 Star 0 Fork 0

xyislove/python-test

加入 Gitee
与超过 1200万 开发者一起发现、参与优秀开源项目,私有仓库也完全免费 :)
免费加入
该仓库未声明开源许可证文件(LICENSE),使用请关注具体项目描述及其代码上游依赖。
克隆/下载
国家药监总局化妆品生产许可证爬取.py 1.93 KB
一键复制 编辑 原始数据 按行查看 历史
xyislove 提交于 2022-01-03 23:16 . 2022.1.3
# 涉及动态加载的数据
# 首页 url='http://scxk.nmpa.gov.cn:81/xk/'
# 动态加载的页面为 url='http://scxk.nmpa.gov.cn:81/xk/itownet/portalAction.do?method=getXkzsList'
# ajax加载
# 带有参数的post请求
# json的数据处理方式
import requests
from fake_useragent import UserAgent
import random
import json
import pprint
def post_1(headers,id_list):
# 目标url
# 第一层请求
post_url_1='http://scxk.nmpa.gov.cn:81/xk/itownet/portalAction.do?method=getXkzsList'
for page in range(1,300):
# 参数封装
data_1={
'on': 'true',
'page': '1',
'pageSize': '15',
'productName':'' ,
'conditionType': '1',
'applyname': '',
'applysn': ''
}
resp=requests.post(url=post_url_1,headers=headers,data=data_1)#post请求的参数标签为data
resp_json_1=resp.json()
resp.close()
# print(type(resp.text))
print(type(resp_json_1))
# pprint.pprint(resp_json['list'])
for i in resp_json_1['list']:
i=i['ID']
id_list.append(i)
return id_list
def post_2(headers,id_list,all_data):
# 第二层请求
post_url_2='http://scxk.nmpa.gov.cn:81/xk/itownet/portalAction.do?method=getXkzsById'
for i in id_list:
data_2={
'id': id_list[0]
}
resp=requests.post(post_url_2,headers=headers,data=data_2)
resp_json_2=resp.json()
resp.close()
all_data.append(resp_json_2)
# pprint.pprint(resp_json_2)
with open('./国药化数据.json',mode='w',encoding='utf-8') as f:
json.dump(all_data,fp=f,ensure_ascii=False)
print('结束')
if __name__=='__main__':
# 请求头封装
ua=UserAgent()
headers={'User-Agent':ua.random}
# 第一层抓取
id_list=[]
id_list=post_1(headers,id_list)
# 第二层抓取
all_data=[]
post_2(headers,id_list,all_data)
马建仓 AI 助手
尝试更多
代码解读
代码找茬
代码优化
1
https://gitee.com/xyislove/python-test.git
git@gitee.com:xyislove/python-test.git
xyislove
python-test
python-test
master

搜索帮助