腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
3
回答
网站
强制
抓取
重定向
python
、
scrapy
、
scrapy-spider
我不断地从www.caribbeanjobs.com被
重定向
。我已经编程我的蜘蛛不服从robot.txt,禁用cookies,尝试meta=dont_redirect。我还能做什么?
浏览 4
提问于2016-08-25
得票数 2
回答已采纳
1
回答
使用anemone从
网站
获取urls列表时出错
ruby
、
anemone
www.example.com/") do |anemone| puts page.urlend 当我尝试这个代码时,我应该得到该
网站
上所有urls的列表,但我得到的只是
网站
的名称。
浏览 0
提问于2012-09-04
得票数 3
回答已采纳
2
回答
Scrapy没有拿起我的url
python
、
scrapy
、
scrapy-spider
Postal Code': people.css('div.person-search__table--postalCode::text').extract_first(),但是我一直得到0个
抓取
的页面
浏览 0
提问于2017-02-16
得票数 0
2
回答
站点重组后重新编制索引的最佳实践
google-index
我正在重新组织我的
网站
。实现平稳过渡的最佳途径是什么?已删除为不再相关的页。要求谷歌重新索引
网站
有什么好处吗? 应该永久保留
重定向
位置,或者在一段时间之后。
浏览 0
提问于2017-02-02
得票数 0
回答已采纳
1
回答
如何使用SwiftSoup
抓取
重定向
的特定
网站
?
javascript
、
html
、
swift
、
redirect
、
swiftsoup
我正在尝试让Swift
抓取
网站
使用SwiftSoup。然而,像https://apple.news/AQZXxg8mUQfKrEaM9MRBpxw这样的
网站
,它会使用JavaScript自动
重定向
,这会导致SwiftSoup
抓取
打开的页面,而不是我想要的实际文章我应该如何
抓取
这个链接,这样它才能
抓取
实际的文章,而不是
重定向
的封面网页? 我尝试使用状态码,但这个
网站
没有给出301或302的状态码,而是200
浏览 52
提问于2019-06-19
得票数 4
1
回答
网页
重定向
在IE,Chrome.不是火狐?
.htaccess
、
http-status-code-301
使用firebug,
抓取
HTTP报头。firefox提供200 OK状态。问题是页面不应该
重定向
。htaccess只
强制
WWW..。
浏览 3
提问于2011-03-23
得票数 0
1
回答
Facebook scraper使用了不正确的DNS数据>我的
网站
未被
抓取
facebook
、
facebook-graph-api
、
dns
、
ip
、
scraper
我最近将我的一个
网站
(gezondbenjij.nl)转移到了一个新的托管账户。这产生了一个新的IP地址。 不幸的是,自从迁移以来,Facebook的
抓取
器无法在新的IP地址上找到我的
网站
。我已经在gezondbenjij.com --> gezondbenjij.nl设置了一个域别名,并将旧的主机帐户
重定向
到这个.com域。这样,facebook通过旁路被
重定向
到正确的站点,但仍然无法
抓取
该站点。因此,我尝试在facebook上分享的URL目前不会生成代码片段。有没有办法
浏览 0
提问于2014-04-18
得票数 6
1
回答
在google
网站
管理员中为同一
网站
添加多个域
seo
、
google-search-console
我有三个域:2
重定向
到 在谷歌
网站
管理员中,我添加了ontwerpbureaujan,我是否也必须添加其他内容?或者我是否得到重复的内容,我是否必须使用规范的URL?多么?‘'Standenbouw’是我的主要seo关键字,也许我应该在
网站
管理员中添加,而不是在ontwerpbureaujan上添加?
浏览 1
提问于2014-05-29
得票数 1
回答已采纳
1
回答
忽略
重定向
的Python检索文件
python
、
beautifulsoup
、
urllib
我正在开发一个程序,它使用Beautiful Soup来
抓取
网站
,然后使用urllib来检索在
网站
上找到的图像(使用图像的直接URL)。我正在
抓取
的
网站
不是图像的原始主机,但确实链接到原始图像。我遇到的问题是,对于某些
网站
,检索www.example.com/images/foobar.jpg会将我
重定向
到主页www.example.com,并生成一个空的(0KB)图像。事实上,转到www.example.com/images/f
浏览 0
提问于2014-03-15
得票数 0
1
回答
使用IIS工具包时的System.Net.HttpWebException
ruby-on-rails
、
ssl
、
iis
、
https
、
seo
在我的客户站点上运行IIS SEO工具包时,我收到以下错误:Details: System.Net.WebException: The request was aborted: Could not create SSL/TLS secure channel. at Microsoft.Web.Management.SEO.
浏览 13
提问于2017-08-23
得票数 3
回答已采纳
2
回答
如何有效地让Google知道我的子域现在有一个自定义域?
domains
、
google-search-console
、
subdomain
、
search-results
、
tumblr
在此之前,我的
网站
已经在谷歌
网站
管理员工具中得到了验证。因此,我想,在将我的自定义域与Tumblr集成之后,我只会让Google知道Google
网站
管理员工具中的域名变化。所以现在我所做的是注册我的新的自定义域作为单独的
网站
,并验证它。现在在我的
网站
管理员工具中有两个站点,我的子域Tumblr URL (它现在是一个
重定向
的,甚至不是一个页面)和我的自定义URL。这是否有负面影响,还是我应该删除我的子域
网站
从谷歌
网站
管理员工具,并删除验证标签? <em
浏览 0
提问于2014-02-04
得票数 2
2
回答
如何在浏览器中避免
重定向
browser
、
http-redirect
当我访问它们时,很少有
网站
被
重定向
到其他一些链接。例如,当我从我的浏览器通过facebook登录时,如果我同时打开另一个标签,在这个标签中我打开了任何支持FbLogin功能的
网站
(比如Nextag.com),那么该
网站
会自动
重定向
到登录页面,我也会自动登录我如何
强制
网站
重定向
,或者我如何
强制
它们
重定向
到我想要的页面。
浏览 2
提问于2012-09-27
得票数 1
回答已采纳
6
回答
要求facebook重新
抓取
URL
facebook
、
facebook-graph-api
网站
的og:图像最近发生了变化。该
网站
包含100多个页面,每个页面都包含各自的og:image。我如何请求或
强制
facebook重新
抓取
所有页面,以便更新图像?直到facebook重新
抓取
该
网站
,我将无法提交应用程序的集合。
浏览 0
提问于2013-05-03
得票数 18
回答已采纳
2
回答
CURL不返回整个html源代码
php
、
curl
我想
抓取
远程站点的html代码,为此我使用CURL,这是我的代码 curl_close($ch); 这几乎对每个
网站
都有很好的效果但是有1个
网站
,
抓取</
浏览 5
提问于2013-03-28
得票数 0
回答已采纳
2
回答
Google没有正确地缓存我的AJAX爬行应用程序吗?
javascript
、
jquery
、
html
、
ajax
、
seo
_escaped_fragment_=并执行302
重定向
到为完全呈现的HTML提供服务的URL。为了测试这一点,这个部分工作得很好,可以在这里导航:,您将看到
重定向
和完全呈现的站点的内容。尽管如此,google仍然不会正确地缓存或
抓取
我的应用程序,并且仍然显示应用程序的加载页面。然而,在
网站
管理员工具中作为googlebot获取,我得到了以下响应: Cache-Control: private Content-Type: text/html</
浏览 5
提问于2013-09-10
得票数 6
1
回答
使用Nokogiri/Open URI获取动态生成的HTML
ruby
、
nokogiri
、
open-uri
我试图通过在Chrome中查看
网站
的HTML并使用Nokogiri
抓取
数据来
抓取
网站
。问题是有些标签是动态生成的,当使用open-uri时,它们不会与open(url)请求一起出现。有没有办法“
强制
”一个
网站
动态生成它的内容,以便像open uri这样的工具读取?
浏览 5
提问于2013-07-07
得票数 5
1
回答
php curl数据
抓取
php
、
curl
我有一个CURL代码来从一个
网站
获取数据,它在过去的几个月里工作得很好,但突然停止了对我的工作,它说我的代码是: $ch = curl_init
浏览 0
提问于2011-10-25
得票数 1
1
回答
nutch hadoop只有一个从站在爬行
hadoop
、
fetch
、
nutch
我有一个3-slaves hadoop集群,我在一个
网站
上执行
抓取
。但是,只有一个从设备正在执行
抓取
(尽管其他从设备仍然处于活动状态)。如果只
抓取
1个域,这是正常行为吗?有没有办法
强制
其他的从属进程去获取? 谢谢。
浏览 0
提问于2012-05-24
得票数 0
1
回答
跨不同域的身份验证
php
、
wordpress
、
ssl
、
ldap
我正在运行一个Wordpress
网站
,但我觉得这个问题的解决方案可能更通用,所以我在这里寻求帮助。这种设置是可能的吗?
浏览 0
提问于2010-11-21
得票数 0
点击加载更多
相关
资讯
抓取整个网站-免费抓取整个网站数据信息软件
什么是网站数据抓取
ENS域名重定向网站项目ENS Redirect正式推出
报道称微软已采取强制措施,“邮件和日历”应用重定向至 Outlook
Cloudflare 称 Perplexity绕过限制,抓取明令禁止 AI 抓取的网站
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券