腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
关于
抓取
大量
JavaScript
网站
的
建议
javascript
、
python
、
selenium-webdriver
、
web-scraping
我想用2016年纽约马拉松()
的
参赛者信息做一个数据库。这是一个
大量
使用
javascript
的
网站
,它需要为每个跑步者点击每个“展开结果”来加载他们
的
信息。正如您所看到
的
,有超过50,000名跑步者,所以这项任务并不容易。 我一直在尝试使用Python-selenium来做到这一点。首先,我点击“显示更多”,直到我得到所有跑步者
的
列表。然后,我单击每个跑步者
的
“展开结果”按钮,最后使用BeautifulSoup获得我想要
的</
浏览 16
提问于2017-08-23
得票数 0
回答已采纳
1
回答
关于
抓取
网站
内容
的
建议
java
、
web
、
web-crawler
、
web-scraping
、
jsoup
我试着
抓取
一些
网站
内容,使用和java
的
组合。将相关详细信息保存到我
的
数据库中,并每天进行相同
的
活动。但是,当我使用jsoup(来自Java类)进行解析/get时,只有最初
的
网站
被下载用于解析。这意味着
浏览 1
提问于2012-07-02
得票数 1
回答已采纳
2
回答
Sitemap for SEO - overlay还是单个页面?
html
、
seo
、
sitemap
快速问题-我要添加一个
网站
地图到我设计
的
网站
-只是为了搜索引擎优化
的
目的。站点地图是否可以出现在jquery覆盖图中(它只是非常小,并且仍然可以在单独
的
页面中)。或者,最好
的
做法是将页面作为标准链接保持独立? 干杯保罗
浏览 0
提问于2012-02-10
得票数 1
回答已采纳
1
回答
在Chrome中使用Headless模式效率较低?
python
、
selenium
、
selenium-webdriver
、
web-scraping
、
selenium-chromedriver
我使用selenium +美汤(使用selenium打开包含
大量
javascript
的
页面,并使用
javascript
命令将其转换为BeautifulSoup对象)来从体育
网站
上
抓取
数据,但由于某些原因当我使用chromedriver实现无头浏览器时,我几乎不会像让chromedriver打开并运行时那样
抓取
大量
数据。有没有人有类似的问题,或者有什么
建议
?document.documentElement.outerHTML'
浏览 2
提问于2020-05-09
得票数 0
3
回答
如何重定向特定IP地址
javascript
、
php
、
html
、
web-crawler
我想重定向蜘蛛从访问我
的
博客。我正在寻找一个解决方案,可以嵌入到网页HTML,以便蜘蛛被重定向离开之前,影响我
的
页面访问量。比如说
javascript
,爬虫
的
IP地址,以及爬虫
的
引用url,这是可能
的
吗?
浏览 0
提问于2013-12-13
得票数 0
2
回答
HTTP错误999:请求被拒绝
python
、
web-scraping
、
beautifulsoup
、
linkedin
、
mechanize
我正在尝试使用BeautifulSoup从LinkedIn中
抓取
一些网页,但一直收到错误“HTTPerror999:请求被拒绝”。有没有办法避免这个错误。如果你看我
的
代码,我已经尝试了Mechanize和URLLIB2,这两个都给了我相同
的
错误。
浏览 6
提问于2015-05-17
得票数 9
回答已采纳
1
回答
爬
网站
点时
的
ServerErrorException
import.io
我正在用API对一个
网站
做一个完整
的
抓取
,我得到了很多:此外,我还收到超时响应和实际
的
http失败:StatusCode: 504, ReasonPhrase: 'GATEWAY_TIMEOUT' 我正在浏览
的
网站
,我正在爬行
浏览 1
提问于2015-05-12
得票数 2
1
回答
Python从受保护
的
网站
获取数据
python
、
post
、
cookies
、
get
、
urllib2
我想知道是否有方法从我
的
银行
网站
上获取信息,我想检索我
的
信用卡历史并显示它,并可能每个月将它保存到一个文本文档中。我已经找到了网址分机登录,并从
网站
获取信息,该
网站
从浏览器工作,但我一直在使用liburl2“打开”来自Python
的
网页,我有一种感觉,因为一些曲奇或会话
的
东西,它不工作。我可以从一个不需要用urllib2登录
的
网站
获得任何我想要
的
信息,然后保存实际
的
HTML,稍后再浏览,但是我不能在
浏览 1
提问于2012-03-10
得票数 2
3
回答
如何在外部
网站
上获取被
javascript
隐藏
的
url?
javascript
、
asp.net
如何在外部
网站
上获取被
javascript
隐藏
的
url?
javascript
:__doPostBack('ctl00$masterContent$DataPager2$ctl00$ctl00','')
javascript
:__doPostBack('ctl00$masterContent$DataPager1$ctl00$ctl01
浏览 1
提问于2012-08-21
得票数 0
1
回答
使用漂亮
的
汤选择css选择器
python
、
html
、
css
、
web-scraping
我正在使用html请求和漂亮
的
汤(我对此是新手)
的
网络摩天大楼工作。previewAttribute=32%20Rose%20Pommette),我正在尝试
抓取
图像链接,这对于多个网页总是相同
的
。product-shots.c-image-gallery > div > picture:nth-child(1) > img') 它返回None 或find_all: soup.find_all('img') 但是特定
的
链接不在列表中
浏览 11
提问于2021-04-20
得票数 0
1
回答
发送一堆http请求
的
最快方法
http
、
https
、
python-requests
因此,我正在构建一个应用程序,需要从一堆
网站
上
抓取
大量
数据,我想知道最快
的
方法是什么?我愿意接受所有的
建议
、所有的编程语言和所有的方法,只要它们至少有任何
关于
它们
的
信息。到目前为止,我所能达到
的
最快速度是在本地主机上生锈
的
300 is中
的
1000个请求。
浏览 7
提问于2022-01-18
得票数 0
1
回答
关于
大量
插入
的
建议
sql
、
oracle
、
sql-insert
我需要创建一个查询,在验证cod_mat.Another 1、2、4、5和6是否存在于tb_profile_cd中时,在tb_profile_mbx表中执行一个插入操作,其中包含tb_profile
的
cod_matrix参数,而每个在tb_mbx表中都有自己
的
ID,而concil具有多个cod_matrix点,即concil代表了tb_profile_cd表
的
id_cd。还有一点是,正如我前面所说
的
那样,concil有很多cod_mat。我有大约两万张唱片,每个康奈尔.为了满足我
的
需要,尝试查阅下面的查
浏览 1
提问于2020-05-04
得票数 1
回答已采纳
1
回答
索引动态加载页
indexing
、
web-crawler
Google索引动态加载页面吗?index.html几秒钟后index.html谷歌会索引div#dynamic_message吗?谢谢。
浏览 1
提问于2011-01-14
得票数 1
1
回答
在Linkedin上爬行0页
python
、
scrapy
、
linkedin
我想在LinkedIn上使用Scrapy,但是我得到了这样
的
输出:2018-10-23 13:36:40 [scrapy.core.engine] INFO: Spider closed (finished)import scrapy
浏览 0
提问于2018-10-23
得票数 0
5
回答
使用Web crawler进行价格比较
java
、
web-crawler
我需要一个开源
的
基于java
的
web crwaler,我可以扩展它
的
价格比较?我怎么比较价格呢?有没有开源
的
代码呢?
浏览 1
提问于2010-02-16
得票数 6
1
回答
为什么BeautifulSoup无法从页面源代码中
抓取
完整
的
脚本?
python
、
web-scraping
、
beautifulsoup
我正在尝试解析来自以下
网站
的
页面。然而,
抓取
的
结果脚本与我在Chrome上查看页面源代码时观察到
的
脚本并不相同。clientprint(soup.prettify()) 生成
的
脚本也要短得多你知道为什么我不能根据页面来源刮掉完整
的
脚本吗?我读过一些帖子,其中提到,由于页面由使用
java
浏览 3
提问于2020-07-23
得票数 0
2
回答
从第三方
网站
检索和
抓取
大量
数据
php
、
mysql
OI希望从第三方
网站
检索和
抓取
大量
有关用户
的
数据。一旦该用户登录,我就会从第三方
网站
获取他们
的
数据,并将其
抓取
。如何才能最有效地防止服务器上
的
大量
负载,并确保页面加载不会太慢?你们有没有其他
的
建议
给我? 我使用
的
是PHP和Mysql。
浏览 0
提问于2011-08-21
得票数 0
1
回答
Jaunt scraper能够
抓取
这个
javascript
站点吗?
java
、
web-scraping
我以前从来没有做过网络
抓取
,实际上就在3个小时前,我用谷歌搜索了网络
抓取
这个词,看看它是什么意思……这就是我在这个问题上
的
能力水平,但我有一个任务是从这个
网站
"betstars.uk“上搜集一些不同足球比赛
的
数字,从我所看到
的
来看,它是一个
javascript
网站
(是吗?)这使得本已困难
的
任务对我来说更加困难,那么JAVA
的
JAVA可以完成这项工作吗?或者我需要其他东西?我之所以这样问,是因为为了避免花一个
浏览 0
提问于2016-09-13
得票数 1
1
回答
数据被 ;隐藏,并在使用Beautiful Soup
抓取
网页时重新生成类
web-scraping
、
beautifulsoup
、
hidden-field
我试图从一个
网站
获取定价数据,但每次页面加载时,t类都会重新生成一个不同
的
字母序列,并且价格显示为 而不是数字。有没有什么技术可以让我以某种方式绕过它?谢谢!下面是我检查元素时显示
的
html行: <div class="qFwqmC hkVukg2 njGalW"> </div> 您
的
帮助将不胜感激
浏览 1
提问于2018-04-07
得票数 0
1
回答
如何使浏览任务自动化?
php
、
python
、
perl
、
curl
、
selenium
我需要创建一个
网站
,这样做(有点更简单
的
界面),考虑到
网站
正在使用Servlets,我没有访问
网站
代码。起初,我尝试了CURL,但是由于页面中有一些Ajax元素,curl无法显示该内容。问题不在于我
的
链接是
Javascript
的
执行,它们是从
Javascript
开始
的
:而且我认为我不能用机械化来调用函数。有人知道这个任务是否可行吗?
浏览 0
提问于2012-07-17
得票数 1
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
云点播
活动推荐
运营活动
广告
关闭
领券