python获取页面文字信息

# -*- coding: utf- -*-

from selenium import webdriver

import time, re,requests,os,time,random,traceback

import urllib.request,threading

from bs4 import BeautifulSoup

import html.parser

from tkinter import *

from tkinter import ttk

import tkinter.messagebox 

def getHtml(questionId,page):

    chrome_options = webdriver.ChromeOptions()

    chrome_options.add_argument('--start-maximized')  # 最大化运行（全屏窗口）,不设置，取元素会报错

    chrome_options.add_argument('--disable-infobars')  # 禁用浏览器正在被自动化程序控制的提示

    chrome_options.add_argument('--incognito')  # 隐身模式（无痕模式）

    chrome_options.add_argument('--headless')  # 浏览器不提供可视化页面

    driver = webdriver.Chrome(executable_path = "chromedriver",options=chrome_options)  # 打开浏览器

    driver.get("https://www.zhihu.com/question/"+questionId+"/answers/updated?page="+str(page)) # 打开想要爬取的知乎页面 

    # 模拟用户操作

    def execute_times(times):

        for i in range(times):

            print('第'+str(i)+'次点击')

            driver.execute_script("window.scrollTo(0, "+str( * i)+");")

            time.sleep()

        driver.execute_script("window.scrollTo(0, document.body.scrollHeight);")

    execute_times()

    result_raw = driver.page_source  # 这是原网页 HTML 信息

    result_soup = BeautifulSoup(result_raw, 'html.parser')# 然后将其解析

    result_bf = result_soup.prettify()  # 结构化原 HTML 文件

    answers = driver.find_elements_by_class_name("RichContent-inner")

    txt = "start\n"

    for answer in answers:

        if len(answer.text) > :

           txt = txt + answer.text + "\n-----------我是分隔符------\n"

    with open(questionId +"/page_"+str(page)+".txt", 'w',encoding="utf-8") as zhpage:  # 存储路径里的文件夹需要事先创建。

        zhpage.write(txt)

    zhpage.close()

    print("爬取回答页面成功!!!")

    driver.quit()

    return result_soup

def readTxt(path):

    f = open(path,'r',encoding='utf-8')

    strTxt = f.read()

    f.close()

    return strTxt

def main(questionId,startPage,endPage):

    mkdir([questionId])

    for i in range(startPage,endPage):

        try:

           getHtml(questionId,i)

           time.sleep(random.choice(range(,)))

        except Exception:

            traceback.print_exc()

            pass

def mkdir(paths):

    for path in paths:

        if not os.path.exists(path):

            os.mkdir(path)

def getanswer():

    questionId = var_id.get()

    start = var_start.get()

    end = var_end.get()

    main(questionId,start,end)

if __name__ == '__main__':

    main(str(),,)

tk = Tk()

tk.title('获取知乎问题所有答案')

tk.geometry('600x150')

frame = Frame(tk)

Label(tk,text='问题标识:(例：https://www.zhihu.com/question/324405640/answer/720532471中的324405640 )',width=,anchor=W, justify=LEFT).place(x=,y=)

var_id = Variable()

question_id = Entry(tk,textvariable=var_id,width=)

question_id.place(x=,y=)

Label(tk,text='开始页：').place(x=,y=)

var_start = Variable()

e = Entry(tk, textvariable=var_start,width=).place(x=,y=)

var_start.set()

Label(tk,text='结束页：').place(x=,y=)

var_end = Variable()

e = Entry(tk, textvariable=var_end,width=).place(x=,y=)

var_end.set()

Button(tk, text="获取答案", command=getanswer).place(x=,y=)

#tk.mainloop()

python获取页面文字信息的更多相关文章

Python 获取CentOS主机信息
Python 获取主机IP地址 #!/usr/bin/env python #coding:utf-8 import os ip=os.popen("ifconfig eth0|grep ' ...
Python+Selenium 自动化实现实例-获取页面元素信息（百度首页）
#coding=utf-8from selenium import webdriverdriver = webdriver.Chrome()driver.get("http://www.ba ...
我了解到的新知识之----如何使用Python获取最新外汇汇率信息
这个需求本来是来源于公司同事工作中需求,用户需要使用数据分析工具Power BI抓取多页的中国银行官网上当天的外汇数据.但是没能研究出来. 我就开始在网络上找关于使用python来抓取当天汇率的案例分 ...
Javascrip获取页面URL信息
使用Javascript可以方便获得页面的参数信息,常用的几种如下: 设置或获取对象指定的文件名或路径 window.location.pathname 设置或获取整个 URL 为字符串 wind ...
用Python获取Linux资源信息的三种方法
方法一:psutil模块 #!usr/bin/env python # -*- coding: utf-8 -*- import socket import psutil class NodeReso ...
JS获取页面URL信息
下面我们举例一个URL,然后获得它的各个组成部分: http://i.cnblogs.com/EditPosts.aspx?opt=1 window.location.href (设置或获取整个 UR ...
Python 获取本地主机信息
import wmi c = wmi.WMI() for sys in c.Win32_OperatingSystem(): #系统信息 print(sys.Caption) #系统版本号 print ...
python获取群成员信息
#coding: utf-8 import itchat,datetime from itchat.content import TEXT itchat.auto_login(hotReload=Tr ...
PYTHON 获取机器硬件信息及状态
#!/usr/bin/env python # encoding: utf-8 from optparse import OptionParser import os import re import ...

随机推荐

九十、SAP中ALV事件之四，事件子例程的参数
一.我们按照之前SAP说明里面的文字,定义好相关内容二.上图代码对应的文档错了,重现截图一下三.这3个子例程是不需要写调用语句PERFORM的,在SAP内部已经写好了.程序会自动根据名字找到需要调 ...
JAVA中的指针
不同于CPP,JAVA中不需要程序员对指针进行操作.不过,这不代表JAVA没有指针,事实上,JAVA的指针操作都被底层代码封装了.笔者在初学Java时,虽然就了解了形参,实参,StringBuffer ...
心形java和C语言2019/10/17
在网上无意中看到这个代码,学习了一下心形函数的知识:http://mathworld.wolfram.com/HeartCurve.html package dada; /** * 了解Heart C ...
P 1032 挖掘机技术哪家强
转跳点:
struts2 result随笔
一.result:chain(从一个Action转发到另一个Action) chain结果类型有4个属性,分别是: actionName (default) - the name of the ac ...
Kaggle: House Prices: Advanced Regression Techniques
Kaggle: House Prices: Advanced Regression Techniques notebook来自https://www.kaggle.com/neviadomski/ho ...
【redis】redis底层数据结构原理--简单动态字符串链表字典跳跃表整数集合压缩列表等
redis有五种数据类型string.list.hash.set.zset(字符串.哈希.列表.集合.有序集合)并且自实现了简单动态字符串.双端链表.字典.压缩列表.整数集合.跳跃表等数据结构.red ...
ContentProvider ContentResolver ContentObserver 内容：提供、访问、监听
内容提供 public class PersonContentProvider extends ContentProvider{ private static final String AUTHORI ...
ntp时间同步服务器
[root@localhost ~]# ntpdate time.nist.gov 虚拟机时间不对自动同步 sudo ntpdate asia.pool.ntp.org 要是同步后时间还是不 ...
springboot整合mybatis与thymeleaf
1.创建springboot项目 (1)选择Spring Initializr (2)填写自己的Group 与 Artifact (3)选择依赖框架等待maven下载好依赖和插件即可 2.主配置文件 ...

python获取页面文字信息

python获取页面文字信息的更多相关文章

随机推荐

热门专题