玖玖小说 > 其他类型 > 财富圣杯 > 第77章 爬虫抓取的第一份数据:教辅价格(2/6)
功能点击具体的书名、价格,他逐渐锁定了数据所在的标签类别和class名称。这是一个需要耐心和细心的“侦探”工作。
第二、三天:编写第一个爬虫脚本(京东)。
他先尝试抓取单页数据。代码大致如下:
importrequests
frombs4importBeautifulSoup
importpandasaspd
importtime
headers={'User-Agent':'Mozilla/5.0...'}#模拟浏览器请求头
url='https://search.jd.com/...初中数学教辅...'#搜索URL
response=requests.get(url,headers=headers)
soup=BeautifulSoup(response.text,'html.parser')
books=[]
foriteminsoup.find_all('div',class_='gl-i-wrap'):#根据实际class调整
try:
title=item.find('div',class_='p-name').em.get_text(strip=True)
price=item.find('div',class_='p-price').strong.i.get_text()
shop=item.find('div',class_='p-shop').span.get_text(strip=True)ifitem.find('div',class_='p-shop')else'未知'
#评价数有时在另一个标签里,需要更复杂的查找
commit=item.find('div',class_='p-commit').strong.get_text(strip=True)ifitem.find('div',class_='p-commit')else'0'
books.append([title,price,shop,commit])
exceptAttributeErrorase:
print(f"解析错误:{e},跳过此项")
continue
df=pd.D