Python爬虫实例扒取2345天气预报

脚本专栏 2025/1/11 佚名

3 2 1

寒假里学习了一下Python爬虫，使用最简单的方法扒取需要的天气数据，对，没听错，最简单的方法。甚至没有一个函数封装。。

网址：http://tianqi.2345.com/wea_history/53892.htm

火狐中右键查看网页源代码，没有发现天气数据，因此推断网页采用的json格式数据。

右击->查看元素->网络->JS，找到了位置

用Python爬虫下载为json格式数据存储下来，代码如下：

#-*- coding:utf-8 -*- 
import urllib2 
import json 
 
months = [1,2,3,4,5,6,7,8,9,10,11,12] 
years = [2011,2012,2013,2014,2015,2016] 
city = [53892]  #邯郸代码53892 
 
for y in years: 
  for m in months: 
    for c in city: 
      url = "http://tianqi.2345.com/t/wea_history/js/"+str(c)+"_"+str(y)+str(m)+".js" 
      print url 
      html = urllib2.urlopen(url) 
      srcData = html.read() 
      #JsonData = json.loads(srcData) 
      file = open("d:/json/"+str(c)+"handan/weather"+str(c)+"_"+str(y)+str(m)+".json","w") 
      file.write(srcData) 
      file.close()

扒取存到本地：

因为是刚学，学一点就动手实践了一下，还没有学到json的转换，直接使用的正则匹配，提取json中的数据，直接打印

提取转换json文件中的数据Python代码：

#-*- coding:utf-8 -*- 
import json 
import re 
import time 
 
Year = [2014] 
Month = [1] 
 
for y in Year: 
  for m in Month: 
     
    """ 
    2016年2月15日终于改成功。 
    是因为正则匹配后的编码问题，导致输出时无法显示。 
    在每个正则匹配的元组后添加 .decode('gbk').encode('utf-8'),成功输出 
    """ 
    content = fRead.read() 
    pattern = re.compile('{ymd:\'(.*","+item[1].decode('gbk').encode('utf-8'),","+item[2].decode('gbk').encode('utf-8'),","+item[3].decode('gbk').encode('utf-8'),","+item[4].decode('gbk').encode('utf-8'),","+item[5].decode('gbk').encode('utf-8') 
      time.sleep(0.1) 
 
    fRead.close()

使用Sublime Text 3运行

使用正则处理的一大问题就是，格式不整齐，总会漏掉一些数据。可能是由于匹配的速度过快导致部分数据缺失，但是通过time.sleep() 睡眠依旧不能解决问题。

由此可以看出正则匹配时的缺陷，待以后使用Python中专门用于处理json数据的包以后，再重新试一下

Python爬虫,天气预报

标签：

Python爬虫,天气预报

免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

狼山资源网 Copyright www.pvsay.com

评论“Python爬虫实例扒取2345天气预报”

Python爬虫实例扒取2345天气预报

暂无“Python爬虫实例扒取2345天气预报”评论...

www.pvsay.com 狼山资源网

29,905影音资源

44,626技术资源

11,817软件资源

578,645站长资源

最新文章

群星《奔赴！万人现场第2期》[FLAC/分轨][5

2025/1/11

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2025/1/11

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2025/1/11

【古典音乐】詹姆斯·高威《季节》1993[WAV+

2025/1/11

贝拉芳蒂《卡里普索之王》SACD[WAV+CUE]

2025/1/11

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2025/1/11

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

Python爬虫实例扒取2345天气预报

Python爬虫,天气预报

python数据封装json格式数据

谈谈python中GUI的选择

评论“Python爬虫实例扒取2345天气预报”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

友情链接

Python爬虫实例扒取2345天气预报

Python爬虫,天气预报

python数据封装json格式数据

谈谈python中GUI的选择

评论“Python爬虫实例扒取2345天气预报”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存