腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9503)
视频
沙龙
1
回答
爬虫
-
无法访问
爬行
内存
javascript
、
object
、
screeps
我有一个确定要做的作业的脚本,然后
爬虫
请求可用的作业。我已经能够将Job对象存储到
爬虫
的
内存
中,但稍后我无法再调用它。来存储它:我已经将它与游戏教程进行了比较,对于我的生活,我似乎弄不明白为什么我不能从
内存
中访问对象
浏览 14
提问于2017-08-18
得票数 1
1
回答
Perl LWP
内存
泄漏?
perl
、
memory-leaks
、
lwp
我有一个连续运行的
爬虫
(使用Perl ),我使用HTML::TreeBuilder对
爬行
的网页进行提取。我孜孜不倦地删除了我创建的HTML::TreeBuilder的每个实例,但是
爬虫
的
内存
占用却缓慢而稳定地上升(我正在看着它以10到30个字节的速度与每一个
爬行
的页面一起运行(我正在使用Valgrind来测量堆的使用情况现在的流程是这样的: 有没有人暗示在LWP或TreeBuilder中是否存在
内存<
浏览 0
提问于2012-02-15
得票数 0
回答已采纳
1
回答
使用Apify Puppeteer
爬行
时的
内存
问题
javascript
、
python
、
web-crawler
、
puppeteer
、
apify
我一直在做一个Python项目,在这个项目中,用户向程序提供一个很长的URL列表(比如说100个URL),程序将产生100个进程来执行包含
爬虫
代码的JavaScript代码(使用Apify.launchPuppeteer但是,同时调用100个进程的
爬行
代码会占用大量
内存
,这会导致延迟。由于Python代码等待从JavaScript代码写入的文件中读取结果,因此
内存
不足会极大地影响性能并在写入文件时引发错误。我想知道是否有任何方法可以优化JavaScript
爬虫
代码,或者是否有任何可以在两端都进行改进的地方
浏览 60
提问于2020-04-18
得票数 0
回答已采纳
2
回答
Google正在抓取服务器文件
php
、
linux
、
wordpress
、
apache
、
centos
当我使用以下方法进行搜索时:然后,在结果页中,它是showing several inappropriate URLs and that on HTTPS。 怎么解决这个问题?这真的是妨碍搜索引擎优化工作为这个博客。请指点。
浏览 2
提问于2014-11-07
得票数 0
回答已采纳
1
回答
Javascript:如何在不本地保存输出文件的情况下直接上传到S3?
node.js
、
amazon-s3
、
aws-sdk
我在使用nodejs/puppeteer开发
爬虫
时遇到了问题。旧的
爬虫
是: 如果你有这样的情况,我想收到一个指南
浏览 0
提问于2019-08-27
得票数 0
1
回答
如何阻止facebook
爬虫
导致CPU使用率过高
wordpress
、
facebook
、
web-crawler
、
cpu-usage
嗨,我最近在Apache使用率、Apache
内存
使用率和MySQL
内存
使用率方面都得到了很高的峰值。事实证明,
爬虫
以极高的速度访问我的网站,特别是Facebook。我试图将facebook
爬虫
的
爬行
延迟添加到robot.txt文件中,如下所示:Disallow:但我还是看到了高使用率的尖峰。这是由于错误的代码,还是有更好的方法来完全停止
爬虫
使用我的服务器的资源这么多? 任何帮助都是非常感谢的。
浏览 0
提问于2018-05-02
得票数 1
回答已采纳
1
回答
如何修复Adsense错误:“我们的
爬虫
无法访问
这些页面”时,这些页面已经被删除,并且404没有找到?
google-adsense
、
404
、
crawl-errors
谷歌网站管理员工具与网站没有任何问题,我没有
爬虫
错误。但是AdSense似乎仍然在我的旧站点上寻找URL,而且我收到了大量的“页面未找到”错误。它解释道:“我们的
爬虫
无法访问
‘阻止URL’列中列出的页面来确定内容和显示广告。当我们的
爬虫
无法访问
您的内容时,我们将不会显示广告,从而降低收入和覆盖率。请按照”错误“列中的链接学习如何纠正这些
浏览 0
提问于2014-12-11
得票数 3
回答已采纳
1
回答
我如何让谷歌更新我的网站描述?
seo
、
google
可能重复: 谷歌似乎没有更新我主页的描述或标题📷我怎样才能要求谷歌更新我的网站描述?
浏览 0
提问于2012-05-08
得票数 4
1
回答
谷歌看上去比public_html更远吗?
.htaccess
、
subdomain
、
web-crawler
、
vps
我们有一个VPS,我们可以使用WHM/cPanel,我们想知道以下信息:public_html (和visa反之亦然),谷歌网站工具中没有提到吗?
浏览 1
提问于2013-11-22
得票数 0
3
回答
web
爬虫
会在php密码保护页面中检测到这些jpeg吗?
php
、
passwords
、
jpeg
、
web-crawler
如果出现以下情况,网络
爬虫
能够找到jpegs/映像吗? 是这样的吗?
浏览 5
提问于2013-10-08
得票数 0
回答已采纳
1
回答
爬行
延迟:X
seo
、
web-crawlers
、
robots.txt
从以前阅读不同文章的研究中,我了解到robots.txt
爬行
延迟(如crawl-delay: 1 )允许给定的搜索引擎每一秒
爬行
几个网页,而不是停止,直到下一次。在我阅读了以下声明如下之后,我还不清楚它是做什么的:我的问题 crawl-delay: x:这里有人能理解数学是如何运作的吗?
浏览 0
提问于2020-02-23
得票数 1
回答已采纳
1
回答
使用php
爬虫
将数据索引到ElasticSearch
php
、
web-crawler
、
elasticsearch
我想索引
爬行
网站到ElasticSearch,但我不知道,我可以索引
爬行
信息到ElasticSearch与php
爬虫
。我知道Apache可以将
爬行
网站索引到ElasticSearch,但是我对php
爬虫
一无所知!我可以在php web应用程序中使用Apache吗?
浏览 4
提问于2013-05-12
得票数 3
1
回答
什么是
爬行
延迟:1意味着如果它被解释为是?
seo
、
web-crawlers
、
robots.txt
我很难理解crawl-delay: 1的含义,如果它没有被忽略,并且实际上被一个给定的网络
爬虫
所解释。我从斯蒂芬·奥斯特米勒的回答中了解到表示:
爬行
A页
爬行
B页从这点我了解到,每秒
爬行
一个网页,再延迟一秒钟,每分钟
爬行
30个网
浏览 0
提问于2020-02-29
得票数 1
1
回答
AWS :如何确保胶水
爬虫
总是从S3获取最新的文件
amazon-web-services
、
amazon-s3
、
aws-glue
我如何配置胶水
爬虫
,使它只获取最新的文件,而不是使用所有的文件。
浏览 11
提问于2022-10-05
得票数 0
1
回答
这会阻止
爬虫
吗?
wordpress
今天把我的wordpress站点提交给了google站长,我的页面
无法访问
。是以下代码,这是否阻止我的网站被
爬行
和索引?
浏览 2
提问于2018-07-16
得票数 0
1
回答
使用多个EC2实例
爬行
amazon-ec2
、
web-crawler
我用python编写了一个
爬行
过程,它运行在亚马逊上的一个ec2实例上。我已经编写了这个
爬虫
,这样它就可以用它的结果向一个单独的"hub“实例报告。集线器处理
爬虫
的结果,
爬虫
可以自由地继续
爬行
。我在这个
爬行
实例中想到的是,克隆
爬虫
的几个实例很容易,每个实例都要向中心报告以便处理。
浏览 2
提问于2015-01-08
得票数 0
回答已采纳
1
回答
分布式系统中的任务分配
java
、
apache-kafka
我的
爬虫
使用卡夫卡把
爬行
的网站对象的一个主题和水槽将重定向输出到Solr。有多个
爬虫
产生数据卡夫卡。 我的问题是:当一个
爬虫
想要爬一个网站,其他
爬虫
不应该尝试
爬行
它。如何在分布式环境中与它们通信?
浏览 0
提问于2017-06-01
得票数 2
1
回答
Google Crawl错误-
无法访问
的错误
ruby-on-rails
、
jrubyonrails
我对robot.txt的
爬虫
访问也是200次(成功)。然而,当我检查“
爬行
错误”时,几乎每个页面都是“
无法访问
的”,包括域主页本身。唯一没有错误的页面是附件/文件页面(例如pdf、xls、jpg等)。
浏览 0
提问于2011-03-07
得票数 0
回答已采纳
1
回答
如何在apache nutch
爬行
时更改其配置
apache
、
configuration
、
web-crawler
、
nutch
我的
爬虫
(ApacheNotch2.2.1)处于
爬行
状态。我必须更改nutch-site.xml中
爬虫
的一些配置。我已经知道,当
爬虫
处于运行状态时,请避免更改配置。 或者如果我们不能改变
爬虫
的配置,那么如果配置被改变了,它的缺点是什么?
浏览 0
提问于2014-11-26
得票数 1
回答已采纳
2
回答
浏览器限制会影响网页
爬虫
吗?
redirect
、
asp.net-mvc-4
、
web-crawler
return Redirect("/h"); return View(); 问题:如果我限制一些浏览器访问我的主视图,它也会限制对网络
爬虫
的访问吗
浏览 0
提问于2013-02-21
得票数 0
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券