腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
两个开放图形图像(facebook大小和google大小)
facebook
、
google-api
、
share
、
facebook-opengraph
我如何包括开放图形图像(两个不同的;两个不同的大小)
浏览 0
提问于2015-05-27
得票数 1
回答已采纳
1
回答
AWS雅典娜分区键变成“varchar”
sql
、
amazon-web-services
、
amazon-s3
、
athena
例如,我有两个分区键,account_id作为int,record_date作为date。当我执行一个查询时,雅典娜说这些是varchar。我得用“键”来查询。是平常的情况还是我做错了什么?
浏览 5
提问于2022-09-29
得票数 0
1
回答
AWS Glue -在处理XML文件时保留前导零
xml
、
amazon-web-services
、
schema
、
aws-glue-data-catalog
我将XML文件存储在s3桶中,并运行
爬虫
来生成目录表中的模式。生成了目录表,但是当我在AWS Glue Studio中检查输出时,我可以看到以0开头的
数据
正在被删除。00034325 => 34325甚至从int到string的目录表模式
数据
类型的转换都不能解决这个问题。 请告诉我如何解决这个问题。
浏览 4
提问于2022-01-15
得票数 2
1
回答
爬虫
如何比直接连接到
数据
库和提取
数据
要好得多?
amazon-web-services
、
aws-glue
、
hive-metastore
在AWS作业中,为了从DB或S3检索
数据
,我们可以使用2种方法。1)使用Crawler 2)直接连接到DB或S3。 所以,,我的问题是:与直接连接
数据
库和检索
数据
相比,
爬虫
如何更好?
浏览 9
提问于2020-08-26
得票数 1
1
回答
添加列时,应该如何更改Glue Crawler设置?
amazon-web-services
、
aws-glue
我将IoT
数据
从IoT设备中保存到S3中。有7种
数据
,所以我将它们保存到S3的7个子文件夹中。我设置了下面的
爬虫
:-Create为每个S3路径创建一个单一模式进展得很好。但是有一天,新
数据
的列将被添加,您能告诉我如何更改
爬虫
的设置以获得包含所有列的新模式吗?
浏览 5
提问于2022-11-24
得票数 0
回答已采纳
1
回答
在多台计算机上运行crawler4j
java
、
crawler4j
我正在尝试使用实现一个
爬虫
。一切都很好直到: 是否可以: 防止根
数据
文件夹锁定。(因此,我可以同时运行多个
爬虫
副本。)重新启动后,根
数据
文件夹的内容不会删除。(这样我就可以在停下来后恢复爬行器了。)
浏览 3
提问于2014-05-11
得票数 0
1
回答
如果我为我的python脚本做了一个简单的gui,它会影响它的效率吗?
python
、
user-interface
、
tkinter
嗨,我想做一个网页
爬虫
,检查URL的
数据
,如果我做一个简单的Gui,使脚本更容易查找变量的
数据
,添加代码的gui会使我的网络
爬虫
效率降低吗? 我需要
爬虫
尽可能高效,能够尽可能快地处理
数据
。为这个Python脚本制作一个gui,会不会妨碍web
爬虫
的性能?
浏览 3
提问于2015-01-27
得票数 0
回答已采纳
1
回答
AWS Glue Crawler查询
amazon-web-services
、
amazon-s3
、
aws-glue
、
amazon-athena
我有几个AWS胶水
爬虫
安装爬行在S3中的CSV,以填充我的表在雅典娜。我的场景和问题:我每天用更新的版本替换S3中的S3文件。我是否必须再次运行现有的
爬虫
程序,也许是按照一个时间表来用最新的内容更新雅典娜上的表格?或者,如果模式更改(例如添加了其他列),是否只要求
爬虫
运行?我只想确保雅典娜中的表总是按照更新的CSV输出所有
数据
-我很少对表结构进行任何模式更改。如果爬行器只在发生实际结构更改时才需要运行,那么我更愿意少运行它们。
浏览 4
提问于2020-05-10
得票数 0
回答已采纳
2
回答
用
爬虫
更新手工创建的aws胶水
数据
目录表
amazon-web-services
、
aws-glue
、
aws-glue-data-catalog
爬虫
不只是一个带有模式的
数据
目录表,而是创建许多表(即使为所选的每个S3 path选项创建一个模式),这意味着
爬虫
识别不同的模式,不能将它们组合成一个。因此,在中,可以使用
爬虫
更新手动创建的表,我希望
爬虫
不会更改我选择的列的
数据
类型,而是更新用于胶水作业的文件和分区列表,以便稍后处理: 您可能希望手动创建AWS Glue
数据
目录表,然后使用AWS Glue按计划运行的
爬虫
可以添加新的分区,并使用任何模式更改更新表。这也适用于从Apache转移区迁移的
浏览 8
提问于2020-03-27
得票数 1
2
回答
爬行时管理URL的常见方法是什么?
web-crawler
我正在尝试编写一个网络
爬虫
程序,但现在我想知道:存储所有urls的最佳方法是什么,这样
爬虫
就可以一起工作,但不会干扰。
浏览 5
提问于2011-12-28
得票数 0
回答已采纳
1
回答
创建AWS胶水作业需要
爬虫
吗?
amazon-web-services
、
pyspark
、
boto3
、
aws-glue
、
aws-lake-formation
我的问题是:创建胶水作业需要
爬虫
&在湖中创建
数据
库吗? 我的aws角色有一些问题,我没有被授权在LakeFormation中创建资源,所以我想我是否可以跳过它们,只创建一个胶水作业并测试我的脚本?例如,我只想对一个输入的.txt文件进行测试,我将它存储在S3中,我还需要
爬虫
吗?我是否可以使用boto3创建一个胶水作业来测试脚本并对
数据
进行预处理并将
数据
写回s3?
浏览 3
提问于2021-02-07
得票数 3
回答已采纳
2
回答
对于蟒蛇
爬虫
,我应该使用无限循环还是cron作业?
python
、
cron
、
web-crawler
我用python编写了一个
爬虫
,它可以访问60多个网站,解析HTML,并将
数据
保存到
数据
库。哪一个更有效率?无限循环还是cron作业?
浏览 7
提问于2021-05-14
得票数 0
4
回答
自动网络
爬虫
json
、
web-crawler
我正在编写一个
爬虫
,需要从许多网站获取
数据
。问题是每个网站都有不同的结构。我如何才能轻松地编写一个从(许多)不同网站下载(正确)
数据
的
爬虫
?如果网站的结构发生变化,我是否需要重写
爬虫
,或者是否有其他方法?谢谢!
浏览 0
提问于2012-07-20
得票数 1
1
回答
用于
爬虫
应用的
数据
库系统
database
、
web-crawler
我在一个基于java的
爬虫
上工作。我想在我的
爬虫
恢复功能,用户可以在任何时候暂停
爬虫
,在他想要的情况下,
爬虫
崩溃的情况下,他应该能够开始从
爬虫
停止的点上一次爬行。为此,我必须在
数据
库中存储所有outlink (在任何页面找到的链接)。我不确定哪个
数据
库是最好的这类系统,因为它需要非常快的插入和检索的链接从
数据
库和频率插入和检索将非常高。
浏览 2
提问于2012-01-06
得票数 1
回答已采纳
3
回答
如何使
爬虫
能够访问封闭(私有)的wiki?
web-crawler
、
mediawiki
、
user-permissions
我需要向
爬虫
提供访问私有维基的权限。对于如何启用对单个客户端(而不是用户,因为
爬虫
无法登录到wiki)的访问,有什么建议吗?
浏览 2
提问于2011-01-27
得票数 0
回答已采纳
1
回答
AWS胶自定义分类器
aws-glue
、
aws-glue-data-catalog
我已经定义/设置了一个
爬虫
来读取和编录S3桶中的avro文件。但是爬行器/分类器无法读取字段的" doc“属性,因此它在目录中创建一个模式,其中包含字段名和相应的
数据
类型,但没有doc字段值。
浏览 1
提问于2019-06-10
得票数 0
1
回答
是否存在在远程域上检查和遵守robots.txt的转发web代理?
http-proxy
、
robots.txt
、
web-crawler
、
web-proxy
多个自动客户端(例如
爬虫
、刮刀)可以通过代理访问www.example.com的网站,而不违反robots.txt指令,也不需要访问文件本身(=>更简单的客户端和更少的获取robots.txt的请求)。
浏览 0
提问于2012-01-03
得票数 1
回答已采纳
1
回答
Solr将
数据
从“爬行器”核心复制到“搜索”核心
solr
、
solr4
我们正在寻找一个Solr 4.9设置,其中我们有一个非常简单的
爬虫
清除和加载一个“
爬虫
”核心,然后触发一个
数据
副本到“搜索”核心时,爬行完成。这样做的目的是,我们的
爬虫
非常简单,不真正跟踪文档的方式,将有助于进行更新和删除。基本上,
爬虫
将清除整个“
爬虫
”核心,撕毁大约50k个文档(提交1000多个文档),然后触发一些东西将
数据
复制到另一个“搜索”核心。 假设我们必须重新启动搜索核心,如何通过命令行或代码实现这一点?
浏览 9
提问于2014-08-25
得票数 0
回答已采纳
1
回答
如何提取我的
爬虫
目前所站的网址?
python
、
scrapy
、
web-crawler
我正在使用python中的scrapy框架制作一个web
爬虫
。其主要思想是,
爬虫
从页面中提取一些
数据
,如果
数据
符合某些条件,
爬虫
应该提取其当前所处的URL。是否有一些方法/函数可以获得当前的URL?
浏览 5
提问于2016-11-27
得票数 0
回答已采纳
1
回答
如何从同一网站的多个网页中发现公共信息块?
machine-learning
、
web-crawler
这是网络
爬虫
中的一个模式识别任务。传统的
爬虫
获取整个页面的
数据
。如果有任何方法可以让
爬虫
变得有点智能,就像只是识别和捕获信息部分。
浏览 0
提问于2015-05-29
得票数 0
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
即时通信 IM
活动推荐
运营活动
广告
关闭
领券