查看: 90|回复: 0

第一个爬虫程序的开发

[复制链接]

2

主题

0

回帖

0

积分

热心网友

金币
0
阅读权限
220
精华
0
威望
0
贡献
0
在线时间
0 小时
注册时间
2011-11-20
发表于 2025-9-2 20:16:00 | 显示全部楼层 |阅读模式

要点:

  1. 先要进行调用urlopen函数。
  2. 设置网址的变量。
  3. 内容获取:
    1.直接获只会得到源代码,是html文件。
    2.若需要以网页的形式进行展示,需要将源代码以html的文件进行保存,并保存到本地,再执行命令。
点击查看代码
from idlelib.iomenu import encoding
from urllib.request import urlopen  # 在url这个库里面请求模块里调用一个urlopen这个函数  模拟浏览器

url = "http://www.baidu.com"   # 网址

resp = urlopen(url) # 获取网页内容

# print(resp.read().decode("UTF-8"))  # 打印内容.decode是为了字节解码,需要填写字符集(搜索charset,可以找出字符集),可以拿到页码面源代码

with open("mybaidyu.html",mode = "w",encoding = "utf-8") as f:
    f.write(resp.read().decode("UTF-8")) #将源代码以html文件的形式存放在本地,之后可以打开,注意这是自己的网址,从页面源代码中提取内容到自己的网址

访问网页的基本过程
向服务器发送请求,服务器拼装html文件,在对客户端进行响应,发送源代码给客户端,用户电脑会自动执行接受到的html文件。



来源:https://www.cnblogs.com/wangxiaojian-wangjun/p/19070661
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

圆梦公社,专注于为全球华人提供纯粹技术交流的地方,请勿发布任何政治及违法的言论。如有相关侵权、举报、投诉及建议等,请发 E-mail:dzh188@hotmail.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖返回顶部