批量获取title

 1 import requests

 2 from bs4 import BeautifulSoup

 3 import pandas as pd

 4 from openpyxl import Workbook

 5 import concurrent.futures

 6

 7 # 读取 .txt 文件中的 URL

 8 with open("urls.txt", "r") as file:

 9     urls = file.read().splitlines()

10

11 # 存储 URL 和 title

12 data = []

13

14 def fetch_title(url):

15     response = requests.get(url)

16     soup = BeautifulSoup(response.text, "html.parser")

17     title = soup.find("title").text

18     return (url, title)

19

20 with concurrent.futures.ThreadPoolExecutor(max_workers=20) as executor:

21     futures = [executor.submit(fetch_title, url) for url in urls]

22

23     for future in concurrent.futures.as_completed(futures):

24         result = future.result()

25         data.append(result)

26

27 # 将 URL 和 title 写入 Excel 文件

28 df = pd.DataFrame(data, columns=["URL", "Title"])

29

30 book = Workbook()

31 writer = pd.ExcelWriter("titles.xlsx", engine="openpyxl")

32 writer.book = book

33

34 df.to_excel(writer, index=False)

35

36 writer.save()

37 　　由于是最后一起写入到excel，所以单次URL获取不宜过多

批量获取title的更多相关文章

06_Elasticsearch 批量获取mget
06_Elasticsearch 批量获取mget 现在有: http://192.168.32.81:9200/bank/bank_account/1 http://192.168.32.81:92 ...
谷歌、腾讯、百度相应API批量获取地理位置坐标信息及其优缺点
目录: 申请ak 批量获取地理位置目的:通过给定的地理位置名称(如:北京市海淀区上地十街十号),获取经纬度信息. 1.申请ak 以百度Geocoding API为例:http://lbsyun.ba ...
Python3.x：免费代理ip的批量获取并入库
Python3.x:免费代理ip的批量获取并入库一.简介网络爬虫的世界,向来都是一场精彩的攻防战.现在许多网站的反爬虫机制在不断的完善,其中最令人头疼的,莫过于直接封锁你的ip.但是道高一尺魔高一 ...
JS批量获取参数构建JSON参数对象
在做系统的时候,往往查询条件是被严格指定的,大量的查询条件,一两个页面还可以通过dom去一个一个获取,再构建参数对象,请求后台接口. 这里给大家讲一个批量获取前端参数,构建参数对象. <form ...
sql 根据指定条件获取一个字段批量获取数据插入另外一张表字段中+MD5加密
/****** Object: StoredProcedure [dbo].[getSplitValue] Script Date: 03/13/2014 13:58:12 ******/ SET A ...
PHP 批量获取指定目录下的文件列表(递归，穿透所有子目录)
//调用 $dir = '/Users/xxx/www'; $exceptFolders = array('view','test'); $exceptFiles = array('BaseContr ...
批量获取oracle的表和表字段注释【原】
批量获取oracle的表和表字段注释 --用户表注释表 SELECT * FROM USER_TAB_COMMENTS WHERE TABLE_NAME LIKE 'WEB_ISC_%'; --显示指 ...
【Python项目】简单爬虫批量获取资源网站的下载链接
简单爬虫批量获取资源网站的下载链接项目链接:https://github.com/RealIvyWong/GotDownloadURL 1 由来自己在收集剧集资源的时候,这些网站的下载链接还要手动 ...
如何从统计中批量获取BD搜索关键词及对应的入口页面？
前面我们介绍了通过cnzz的访问明细获取到搜索关键词及对应的入口页面,但是从BD搜索进来的关键词无法完整显示,只能呈现一些bd图片搜索的关键词,这是因为百度宣布从去年5月开始逐渐取消了referer关 ...
C#开发BIMFACE系列14 服务端API之批量获取转换状态详情
系列目录 [已更新最新开发文章,点击查看详细] 上一篇<C#开发BIMFACE系列13 服务端API之获取转换状态>中介绍了根据文件ID查询单个文件的转换状态. 本文介绍批量获取转 ...

随机推荐

乌卡时代的云成本管理：从0到1了解FinOps
在上一篇文章中,我们介绍了企业云业务的成本构成以及目前面临的成本困境,以及当前企业逐步转向 FinOps 的行业趋势,这篇文章我们将详细聊聊 FinOps,包括概念.重要性以及成熟度评价指标. 随着对 ...
00-DLL劫持&C语言远程加载shellcode
0x01 杀软拦截检测规则引导-DLL劫持上线准备工具 cs vs2019 dll劫持工具:https://bbs.pediy.com/thread-224408.htm 极速PDF:https:/ ...
CF1742G Orray
题目传送门思路大抵算是一道位运算入门题? 首先为了使 $b_i$ 的字典序最大,我们注意到 $b_1=a_1$,所以 $a_1$ 必然是序列中最大的那个数. 接下来考虑贪心,设当前已经 ...
C#/JS 压缩到指定大小的图片 (内存不足问题修改)
//因为浏览器安全问题,无法获取上传图片地址,需要先存一遍然后再获取地址作参数上传 var des = CompressImage(@"C:\Users\PC\Pictures\测试\165 ...
obj对象数据归类整理
两个字段根据id对应整理 <!doctype html> <html lang="en"> <head> <meta charse ...
在使用vite报global的错
解决:
MogDB 学习笔记之 -- 索引失效
[[toc]]# 概念描述哪些操作会导致分区表的全局索引失效(比如 move partition,drop partition ,truncate partition ,split partition ...
Solution Set - NOIP2022
种花枚举 C 或者 F 最左边的那一竖,考虑对于每一个这一竖上的全 $0$ 区间 $[l,r]$ 求答案. 记每个点向右延伸最多延伸到 $L_{i,j}$,对于 C 的情况,枚举列 \( ...
el-inpu 输入框，输入一个字符失去焦点，不能连续输入问题
问题出现的原因:输入框绑定值改变导致代码从新渲染 <div v-for="(x,index) in item.newAttrs " :key="x.en" ...
20230103~05code
目录 U190849 最简分式 P5734 [深基6.例6]文字处理软件 P1104 生日 P4305 [JLOI2011]不重复数字 P8218 [深进1.例1]求区间和 P3397 地毯 P236 ...

批量获取title

批量获取title的更多相关文章

随机推荐

热门专题