pyppeteer的使用

`pyppeteer`的使用

安装

属于第三方模块进行安装. pip install pyppeteer
在Linux中,如果权限不够则加上. sudo pip install pyppeteer

使用

使用今日头条作为demo

from pyppeteer import launch
import asyncio

async def main(timeout=30):# 设定时间超时, 默认是30秒
    # async 用来申明一个函数是一个异步函数
    browser = await launch(headless=True, args=["--no-sandbox"])
    # 参数说明:
    # headless 参数设为False,变为有头模式
    # Pyppeteer 支持字典和关键字传递参数
    page = await browser.newPage()
    
    # 设置页面大小
    await page.setViewport(viewport={"width":1280, "height":800})
    
    # 是否启用JS, enabled设为False,则无渲染效果
    await page.setJavaScriptEnabled(enabled=True)
    
    # 超时时间设置
    res = await page.goto(url=url, options={"timeout":1000})
    # 响应头
    resp_headers = res.headers
    # 响应状态
    resp_status = res.status
    
    # 等待
    await asynico.sleep(2)
    # 第二种方法
    while not await page.querySelector(".t"):
        pass
    
    # 滚动到页面底部
    await page.evaluate('windows.scrollBy(0,document.body.scrollHeight)')
    
    # 截图报存图片
    await page.screenshot({"path": "toutiao.png"}) 
    
    # 获取cookie
    print(await page.cookies())   
    
    # 打印页面文本信息
    print(await page.content())
    
    # 在页面上执行js脚本
    dimensions = await page.evaluate(pageFunction='''() => {
            return {
                width: document.documentElement.clientWidth,  // 页面宽度
                height: document.documentElement.clientHeight,  // 页面高度
                deviceScaleFactor: window.devicePixelRatio,  // 像素比 1.0000000149011612
            }
        }''', force_expr=False)  # force_expr=False  执行的是函数
    print(dimensions)
    #  只获取文本  执行 js 脚本  force_expr  为 True 则执行的是表达式
    content = await page.evaluate(pageFunction='document.body.textContent', force_expr=True)
    print(content)

    # 打印当前页标题
    print(await page.title())\
    
    # 抓取其他信息
    """
    1.选择器, Page.querySelector()
    2.选择器, Page.querySelectorAll()
    3.xpath表达式, Page.xpath()
    """
    # 使用querySelector()
    element = await page.querySelector(".feed-infinite-wrapper > ul>li") # 只抓取一个
    print(element)
    
    # 获取所有的文本信息, 执行js代码
    content = await page.querySelectorAll('(element) => element.textContent', element)
    print(content)
    
    # 使用xpath
    # elements = await page.xpath('//div[@class="title-box"]/a')
    # 使用选择器全选
    elements = await page.querySelectorAll(".title-box a") 
    for item in elements:
        print(await item.getProperty("textContent"))
        # 获取文本信息
        title = await (await item.getProperty("textContent")).jsonValue()
        # 获取连接
        link = await (await item.getProperty("href")).jsonValue()
        print(title)   
        print(link)
    # 关闭浏览器
    await browser.close()

如何启动程序
1.创建一个event_loop对象
```
   loop = asyncio.get_event_loop()
```
2.启动运行
```
   loop.run_until_complete(main())
```

模拟键盘输入

# 模拟输入 账号密码  {'delay': rand_int()} 为输入时间
    await page.type('#TPL_username_1', "sadfasdfasdf")
    await page.type('#TPL_password_1', "123456789", )
    
    await page.waitFor(1000)
    await page.click("#J_SubmitStatic")

使用tkinter获取页面高度宽度

def screen_size():
    """使用tkinter获取屏幕大小"""
    import tkinter
    tk = tkinter.Tk()
    width = tk.winfo_screenwidth()
    height = tk.winfo_screenheight()
    tk.quit()
    return width, height

针对iframe操作

page.frames获取所有的iframe列表,需要判断操作的是哪一个iframe跟操作page一样

from pyppeteer import launch
import asyncio

async def main(url):
    w = await launch({"headless":False, "args":["--no-sandbox"]})
    page = await w.newPage()
    await page.setViewport({"width":1366, "height":800})
    await page.goto(url)
    try:
        await asyncio.sleep(1)
        frame = page.frames
        print(frame)
        
        title = await frame[1].title()
        print(title)
        
        await asyncio.sleep(1)
        login = await frame[1].querySelector('#switcher_plogin')
        print(login)
        
        await login.click()
        await asyncio.sleep(5)
    except Exception as e:
        print(e)
    for page in await w.pages():
        await page.close()
    await w.close()

asyncio.get_event_loop().run_until_complete(main("https://i.qq.com/?rd=1"))
# asyncio.get_event_loop().run_until_complete(main("https://www.gushici.com/"))

大部分借鉴与别人，目前觉得模拟器爬虫还是比较慢的，静待大家的创新。

pyppeteer的使用的更多相关文章

pyppeteer(python版puppeteer)基本使用
一.前言以前使用selenium的无头浏览器,自从phantomjs2016后慢慢不更新了之后,selenium也开始找下家,这时候谷歌的chrome率先搞出来无头浏览器并开放了各种api,随后fi ...
pyppeteer 报错-无法连接到浏览器
问题程序报错: Failed to connect to browser port: http://127.0.0.1:57899/json/version 原因虽然pyppeteer在首次启动时 ...
pyppeteer爬虫例子
如果在centos上使用,需要安装下面的依赖 yum install pango.x86_64 libXcomposite.x86_64 libXcursor.x86_64 libXdamage.x8 ...
pyppeteer使用笔记
pyppeteer -- python版本的puppeteer,一个强大的chronium headless浏览器API 最近搞天猫用了一波儿,记录一下. 先上文档: https://miyakogi ...
pyppeteer初尝滋味
最近在爬几个电商平台网站用的selenium一登录就会有验证,目前这些网站对selenium检测很严格因为不少大网站有对selenium的js监测机制.比如navigator.webdriver,n ...
网络爬虫之使用pyppeteer替代selenium完美绕过webdriver检测
1引言曾经使用模拟浏览器操作(selenium + webdriver)来写爬虫,但是稍微有点反爬的网站都会对selenium和webdriver进行识别,网站只需要在前端js添加一下判断脚本,很容 ...
Pyppeteer
pyppeteer模块的基本使用引言 Selenium 在被使用的时候有个麻烦事,就是环境的相关配置,得安装好相关浏览器,比如 Chrome.Firefox 等等,然后还要到官方网站去下载对应的驱动 ...
pyppeteer进阶技巧
记录一下在使用pyppeteer过程中慢慢发现的一些稍微高级一点的用法. 一.拦截器简单用法拦截器作用于单个Page,即浏览器中的一个标签页.每初始化一个Page都要添加一下拦截器.拦截器实际上是 ...
爬虫的新模块pyppeteer的使用
安装 python3 -m pip install pyppeteer 最好是py3.5+ 手动安装你懂的,天朝网络环境很复杂,如果要用pyppeteer自己绑定的chromium,半天都下载不下来 ...

随机推荐

Java - 自动配置log4j的日志文件路径
目录 1 日志路径带来的痛点 2 log4j.properties文件的配置 3 彻底解决痛点 3.1 单独的Java程序包 (非Java Web项目) 3.2 Web项目 4 附录 - 获取当前项目 ...
maven打jar包包括依赖包
<build> <plugins> <plugin> <artifactId>maven-compiler-plugin</artifactId& ...
数据结构之堆栈java版
import java.lang.reflect.Array; /* 具体原理在c++版已经说的很清楚,这里不再赘述, 就提一点:java的泛型具有边界效应,一旦离开作用域立马被替换为object类型 ...
mysql row size上限
mysql innodb 的 row size上限背景在项目使用中,出现了以下报错: Error Code: 1118 - Row size too large (> 8126). Chan ...
vs 中本地 git 的基本使用
用 svn 有个毛病就是只有在改好了之后,才能提交.当周期比较长的时候,连自己都不知道自己改了什么东西,或者意外断电的时候,vs 中已保持的项目都有可能被 vs 去掉. 这个时候,使用 git 创建 ...
Redis总结（九）Linux环境如何安装redis
以前总结Redis 的一些基本的安装和使用,由于是测试方便,直接用的window 版的reids,并没有讲redis在linux下的安装.今天就补一下Linux环境如何安装redis. 大家可以这这里 ...
React中控制台警告
1.dll_lib.js:1 Warning: bind(): You are binding a component method to the component. React does this ...
C#读取Txt大数据并更新到数据库
环境 Sqlserver 2016 .net 4.5.2 目前测试数据1300万大约3-4分钟.(限制一次读取条数和线程数是要节省服务器资源,如果调太大服务器其它应用可能就跑不了了), Sql ...
TinyMCE使用
1.文本&文本字体颜色与word类似不赘述 2.字体加粗&划线与word类似不赘述选中后 ctrl + B 加粗快捷键选中后 ctrl + I 斜体快捷键选中后 c ...
xss实体绕过示例
知识点: 倘若是在script.input标签当中,即可突破. Payload ' oninput=alert`1` // 当要在input中输入内容时触发事件 ' oninput=alert`1` ...

pyppeteer的使用

pyppeteer的使用

安装

使用

模拟键盘输入

使用tkinter获取页面高度宽度

针对iframe操作

pyppeteer的使用的更多相关文章

随机推荐

热门专题

`pyppeteer`的使用