百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术分类 > 正文

python实现爬取豆瓣电影Top250

ztj100 2025-05-26 20:20 13 浏览 0 评论


最近学习了用python爬取某网站电影Top250的数据,在这里记录一下。

需要引入几个模块

from bs4 import BeautifulSoup    	# 网页解析,获取数据
import re      																	 # 正则表达式,进行文字匹配
import urllib.request,urllib.error   	# 制定URL,获取网页数据
import xlwt    																	# 进行Excel操作

1、爬取网页

首先对该网站进行分析,发现Top250共有10页,每页25条信息。

第一页是:
https://movie.douban.com/top250?start=0

第二页是:
https://movie.douban.com/top250?start=25&filter=

以此类推...... 其中&filter是可以去掉的。

因此定义基础的url变量:baseurl = "
https://movie.douban.com/top250?start="

将其置于for循环中,start=可以根据for循环的变量添加

    for i in range (0,10):              # 调用获取页面信息的函数10次
        url = baseurl+str(i*25)

1.1、获取网页源代码

这里的基础知识详见:
https://blog.csdn.net/Zhouzi_heng/article/details/108573489

首先我们要模拟浏览器对该网站进行访问。可以查看自己浏览器的代理,进行模仿。

用户代理,告诉豆瓣服务器,我们是什么类型的机器、浏览器(本质上是告诉浏览器,我们可以接受什么水平的文件内容)

然后用urllib.request.Request()方法进行请求的模仿,并返回得到的信息。

第三步将请求返回的内容作为参数,传递到urlopen方法中,进行网页信息的爬取。

最后在加入异常判断。

#得到指定一个URL的网页内容
def askURL(url):
    #用户代理,告诉豆瓣服务器,我们是什么类型的机器,浏览器(本质上是告诉浏览器,我们可以接受什么水平的文件内容)
 
    #头部信息,模拟浏览器头部信息,向豆瓣浏览器发送消息
    head={"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36"}
    #请求
    request = urllib.request.Request(url,headers=head)
    #存储
    html = ""
    try:
        response = urllib.request.urlopen(request)
        html = response.read().decode("utf-8")
        #print(html)
    except urllib.error.URLError as e:
        if hasattr(e,"code"):
            print(e.code)
        if hasattr(e,"reason"):
            print(e.reason)
    return html

2、对获取到的信息逐一进行解析

BeautifulSoup的基础知识详见:
https://blog.csdn.net/Zhouzi_heng/article/details/108586516

我们这里用是HTML解析,因此,定义

soup = BeautifulSoup(html,"html.parser")       #解析

定义一个list保存一部电影的信息:data=[]

查看原码发现,每部电影都是 li标签,对于其中每一个电影,是从 <div class="item">开始的

那么我们就从这里开始查找网页中的字符串。

通过正则表达式来进行查找相应的字符串是比较方便的

影片详情的正则表达式规则

findLink = re.compile(r'<a href="(.*?)">')

依此类推

#影片图片的链接规则
findImaSrc = re.compile(r'<img.*src="(.*?)"',re.S)    #re.S让换行符包含在字符中
#影片片名
findTitle = re.compile(r'<span class="title">(.*)</span>')
#评分
findRating = re.compile(r'<span class="rating_num" property="v:average">(.*)</span>')
#评价人数
findJudge = re.compile(r'<span>(\d*)人评价</span>')
#找到概况
findInq = re.compile(r'<span class="inq">(.*)</span>')
#找到影片的相关内容
findBd = re.compile(r'<p class="">(.*?)</p>',re.S)     #re.S让换行符包含在字符中

再用re库来通过正则表达式查找指定的字符串,并添加到data中

对影片详情的超链接的添加:

#影片详情的超链接
link = re.findall(findLink,item)[0]            #re库用来通过正则表达式查找指定的字符串
data.append(link)                              #添加链接

其他的以此类推

imgSrc = re.findall(findImaSrc,item)[0]
            data.append(imgSrc)                            #添加图片
 
            titles = re.findall(findTitle,item)
            if (len(titles)==2):
                ctitle = titles[0]
                data.append(ctitle)                            #添加中文名
                otitle = titles[1].replace("/","")            #去掉/
                data.append(otitle)                           #添加外国名
            else:
                data.append(titles[0])
                data.append(" ")                              #外国名留空
 
            rating = re.findall(findRating,item)[0]
            data.append(rating)                             #添加打分
 
            judgeNum = re.findall(findJudge,item)[0]
            data.append(judgeNum)                           #添加评价人数
 
            inq = re.findall(findInq,item)
            if len(inq)!=0:
                inq = inq[0].replace("。","")              #去掉句号
                data.append(inq)                                #添加概述
            else:
                data.append(" ")                          #留空
 
            bd = re.findall(findBd,item)[0]
            bd = re.sub('<br(\s+)?/>(\s+)?'," ",bd)       #去掉<br/>
            bd = re.sub('/'," ",bd)                       #替换/
            data.append(bd.strip())                       #去掉前后的空格

需要注意的是title有中文名和外文名(英文、韩语等),需要特殊处理。概况和影片相关内容也需要处理。

最后再用一个datalist的列表将data进行存储。

3、保存数据

不同的是需要加入行说明

book = xlwt.Workbook(encoding="utf-8",style_compression=0)  # 1创建workbook对象
    sheet = book.add_sheet("豆瓣电影Top250",cell_overwrite_ok=True)  # 2.创建worksheet  创建工作表  cell_overwrite_ok=True覆盖以前的内容
 
    col = ("电影详情链接","图片链接","影片中文名","影片外国名","评分","评价数","概况","相关信息")
    for i in range(0,8):
        sheet.write(0,i,col[i])              #写入列表

再循环250次将之前datalist中的元素存写到worksheet中,并保存

  for i in range(0,250):
        print("第%d条"%(i+1))
        data = datalist[i]
        for j in range(0,8):
            sheet.write(i+1,j,data[j])
 
    book.save(savePath)      #保存名称

4、运行结果

github: https://github.com/StudyWinter/doubanSpider

相关推荐

Spring IoC Container 原理解析

IoC、DI基础概念关于IoC和DI大家都不陌生,我们直接上martinfowler的原文,里面已经有DI的例子和spring的使用示例...

SQL注入:程序员亲手打开的潘多拉魔盒,如何彻底封印它?

一、现象:当你的数据库开始"说话",灾难就来了场景还原:...

Java核心知识3:异常机制详解

1什么是异常异常是指程序在运行过程中发生的,由于外部问题导致的运行异常事件,如:文件找不到、网络连接失败、空指针、非法参数等。异常是一个事件,它发生在程序运行期间,且中断程序的运行。...

MyBatis常用工具类三-使用SqlRunner操作数据库

MyBatis中提供了一个非常实用的、用于操作数据库的SqlRunner工具类,该类对JDBC做了很好的封装,结合SQL工具类,能够很方便地通过Java代码执行SQL语句并检索SQL执行结果。SqlR...

爆肝2W字梳理50道计算机网络必问面试题

1.说说HTTP常用的状态码及其含义?思路:这道面试题主要考察候选人,是否掌握HTTP状态码这个基础知识点。...

SpringBoot整合Vue3实现发送邮箱验证码功能

1.效果演示2.思维导图...

最全JAVA面试题及答案(200+)

Java基础1.JDK和JRE有什么区别?JDK:JavaDevelopmentKit的简称,Java开发工具包,提供了Java的开发环境和运行环境。JRE:JavaRunti...

Java程序员找工作翻车现场!你的项目描述踩了这几个坑?

Java程序员找工作翻车现场!你的项目描述踩了这几个坑?噼里啪啦敲了三年代码,简历一投石沉大海?兄弟,问题可能出在项目描述上!知道为什么面试官看你的项目像看天书吗?因为你写了三个致命雷区:第一,把项目...

2020最新整理JAVA面试题附答案,包含19个模块共208道面试题

包含的模块:本文分为十九个模块,分别是:Java基础、容器、多线程、反射、对象拷贝、JavaWeb、异常、网络、设计模式、Spring/SpringMVC、SpringBoot/Spring...

底层原理深度解析:equals() 与 == 的 JVM 级运作机制

作为Java开发者,你是否曾在集合操作时遇到过对象比较的诡异问题?是否在使用HashMap时发现对象丢失?这些问题往往源于对equals()和==的误解,以及实体类中这两个方法的不当实...

雪花算法,什么情况下发生 ID 冲突?

分布式系统中,有一些需要使用全局唯一ID的场景,这种时候为了防止ID冲突可以使用36位的UUID,但是UUID有一些缺点,首先他相对比较长,另外UUID一般是无序的...

50个Java编程技巧,免费送给大家

一、语法类技巧1.1.使用三元表达式普通:...

如何规划一个合理的JAVA项目工程结构

由于阿里Java开发手册对于工程结构的描述仅限于1、2节简单的概述,不能满足多样的实际需求,本文根据多个项目中工程的实践,分享一种较为合理实用的工程结构。工程结构的原则有依据、实用。有依据的含义是指做...

Java 编程技巧之单元测试用例编写流程

温馨提示:本文较长,同学们可收藏后再看:)前言...

MyBatis核心源码解读:SQL执行流程的奇妙之旅

MyBatis核心源码解读:SQL执行流程的奇妙之旅大家好呀!今天咱们要来一场既烧脑又有趣的旅程——探索MyBatis这个强大框架的核心秘密。你知道吗?当你在项目里轻轻松松写一句“select*f...

取消回复欢迎 发表评论: