python-test
/
国家药监总局化妆品生产许可证爬取.py

# 涉及动态加载的数据
# 首页 url='http://scxk.nmpa.gov.cn:81/xk/'
# 动态加载的页面为 url='http://scxk.nmpa.gov.cn:81/xk/itownet/portalAction.do?method=getXkzsList'
# ajax加载
# 带有参数的post请求
# json的数据处理方式

import requests
from fake_useragent import UserAgent
import random
import json
import pprint


def post_1(headers,id_list):
# 目标url
 # 第一层请求
    post_url_1='http://scxk.nmpa.gov.cn:81/xk/itownet/portalAction.do?method=getXkzsList'
    for page in range(1,300):
# 参数封装
        data_1={
            'on': 'true',
            'page': '1',
            'pageSize': '15',
            'productName':'' ,
            'conditionType': '1',
            'applyname': '',
            'applysn': ''
        }
        resp=requests.post(url=post_url_1,headers=headers,data=data_1)#post请求的参数标签为data
        resp_json_1=resp.json()
        resp.close()
        # print(type(resp.text))
        print(type(resp_json_1))
        # pprint.pprint(resp_json['list'])
        for i in resp_json_1['list']:
            i=i['ID']
            id_list.append(i)
    return id_list

def post_2(headers,id_list,all_data):
    # 第二层请求
    post_url_2='http://scxk.nmpa.gov.cn:81/xk/itownet/portalAction.do?method=getXkzsById'
    for i in id_list:
        data_2={
            'id': id_list[0]
        }
        resp=requests.post(post_url_2,headers=headers,data=data_2)
        resp_json_2=resp.json()
        resp.close()
        all_data.append(resp_json_2)
        # pprint.pprint(resp_json_2)

    with open('./国药化数据.json',mode='w',encoding='utf-8') as f:
        json.dump(all_data,fp=f,ensure_ascii=False)

    print('结束')

if __name__=='__main__':

# 请求头封装
    ua=UserAgent()
    headers={'User-Agent':ua.random}

# 第一层抓取
    id_list=[]
    id_list=post_1(headers,id_list)

# 第二层抓取
    all_data=[]
    post_2(headers,id_list,all_data)