腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
用
HTMLUnit
实现
火
库
网页
的
网络
抓取
firebase
、
web-scraping
、
htmlunit
我使用
htmlunit
2.36.0并尝试擦除:不知何故没有通过javascript执行动态内容获取。有没有人知道怎么修复它?
浏览 4
提问于2019-10-23
得票数 0
1
回答
用
Java在
HtmlUnit
中
实现
网页
抓取
java
、
web-scraping
、
htmlunit
我刚刚开始接触
抓取
之类
的
东西,并且写了一段简单
的
代码。我正在尝试访问这个websie https://parimatch.com (这是一个投注网站),我只想从它获得字符串形式
的
信息,就是它。下面是我
的
代码: public static void main(String[] args) throws IOException { HtmlPage page
浏览 17
提问于2021-10-21
得票数 0
回答已采纳
6
回答
HtmlUnit
的
替代方案
screen-scraping
、
web-crawler
、
htmlunit
、
headless-browser
到目前为止,我一直在研究可用
的
无头浏览器,发现
HtmlUnit
被广泛使用。与
HtmlUnit
相比,我们是否有任何替代
HtmlUnit
的
可能优势? 谢谢Nayn
浏览 3
提问于2010-11-23
得票数 20
回答已采纳
1
回答
使用javascripts在页面上进行web
抓取
java
、
parsing
、
web-scraping
、
htmlunit
我做web
抓取
已经有几个月了,总是被
用
javascript加载数据
的
页面卡住。有没有
实现
这一目标的具体方法? 但就我而言,我还没有深入研究
HTMLunit
。那么你
的
建议是什么呢?我应该坚持使用
HT
浏览 1
提问于2013-06-06
得票数 2
1
回答
Selenium clickAt命令是否适用于无头浏览器?
selenium
、
selenium-webdriver
、
web-scraping
、
phantomjs
、
webautomation
我正在考虑
用
PhantomJS (或
htmlunit
)这样
的
无头浏览器来取代火狐,
用
selenium来进行
网页
抓取
活动。我认为selenium中
的
clickAt命令依赖于页面图形呈现,它在PhantomJS中不起作用。有人能证实这一点吗?
浏览 4
提问于2016-09-30
得票数 1
2
回答
使用Java从特定
的
URL获取整个web页面
java
、
http
我能用Java获取整个
网页
,包括CSS和图片吗?这基本上就是在浏览器中使用“另存为”操作时发生
的
事情。我可以使用任何免费
的
第三方
库
。
HtmlUnit
库
似乎正在做我需要
的
事情。这就是我用它
抓取
整个
网页
的
方法:HtmlPage page = webClient.getPage(new URL("..
浏览 1
提问于2011-06-24
得票数 1
5
回答
自动生成HTTP屏幕
抓取
Java代码
java
、
http
、
selenium
、
screen-scraping
我需要从网站上
抓取
一些数据,因为这些数据不能通过他们
的
web服务获得。当我之前需要这样做时,我已经使用Apache
的
HTTP客户端
库
自己编写了Java代码,以便进行相关
的
HTTP调用来下载数据。通过在浏览器中单击相关屏幕,同时使用记录相应
的
HTTP调用,我找出了需要进行
的
相关调用。正如您可以想象
的
那样,这是一个相当单调乏味
的
过程,我想知道是否有工具可以实际生成与浏览器会话相对应
的
Java代码。我希望生成
的</
浏览 0
提问于2009-01-08
得票数 6
7
回答
最好
的
Java HTTP
库
?
java
、
http
我想为学院项目
用
Java开发http客户端,它可以登录网站,从HTML数据中获取数据,完成表格
的
填写和发送。我不知道该使用哪个http
库
: Apache HTTP客户端-不要创建DOM模型,而是使用http重定向、多线程。
浏览 0
提问于2010-09-12
得票数 7
回答已采纳
6
回答
网络
抓取
和
网络
抓取
有什么不同?
search-engine
、
web-scraping
、
web-crawler
爬行和
网络
抓取
有区别吗? 如果有不同之处,为了收集一些
网络
数据来提供一个数据
库
,以便在定制
的
搜索引擎中使用,最好
的
方法是什么?
浏览 2
提问于2010-12-02
得票数 96
回答已采纳
1
回答
解析
网页
java
、
html
、
css
问题是,当我
用
java加载页面并将其保存到文件中时,它不包含我需要
的
信息。当我单击页面上
的
“查看源”时,也没有任何信息。但是,当我下载页面(另存为)并用记事本打开它时,我能够找到我需要
的
东西。简而言之,java加载
的
网页
不同于我下载并使用记事本打开
的
网页
。 如何将页面加载到字符串中,使其看起来与我在计算机上下载
的
页面相同?
浏览 4
提问于2014-07-02
得票数 2
回答已采纳
2
回答
用
Java从
网页
上
抓取
数据?
java
、
twitter
、
web-scraping
、
bots
、
headless-browser
我正在为我
的
一个班级创建一个twitter机器人,以练习使用队列并构建我
的
简历。这是一个示例
网页
。我
的
理由是,最初是获取
网页
的
链接,然后获取页面源代码,浏览@twitterhandle,然后将这些添加到队列中,以便稍后在构造消息时使用。 我查了一下
网页
来源,但我在
网页
上找不到twitter
的
名字。
浏览 0
提问于2013-03-02
得票数 1
回答已采纳
10
回答
使用Java进行Web
抓取
java
、
web-scraping
、
frameworks
我找不到任何好
的
基于Java
的
web
抓取
API。我需要
抓取
的
站点也不提供任何API;我想使用一些pageID遍历所有
网页
,并在它们
的
DOM树中提取HTML标题/其他内容。除了
网络
抓取
之外,还有其他方法吗?
浏览 1
提问于2010-07-08
得票数 72
回答已采纳
1
回答
Jaunt scraper能够
抓取
这个javascript站点吗?
java
、
web-scraping
我以前从来没有做过
网络
抓取
,实际上就在3个小时前,我
用
谷歌搜索了
网络
抓取
这个词,看看它是什么意思……这就是我在这个问题上
的
能力水平,但我有一个任务是从这个网站"betstars.uk“上搜集一些不同足球比赛
的
数字,从我所看到
的
来看,它是一个javascript网站(是吗?)这使得本已困难
的
任务对我来说更加困难,那么JAVA
的
JAVA可以完成这项工作吗?或者我需要其他东西?我之所以这样问,是因为为了避免花一个
浏览 0
提问于2016-09-13
得票数 1
5
回答
如何使用Python将数据输入到
网页
以
抓取
结果输出?
python
、
scrape
我熟悉从
网页
抓取
数据
的
BeautifulSoup和urllib2。但是,如果在返回我想要
抓取
的
结果之前需要在页面中输入一个参数,该怎么办?我正在尝试使用这个网站获取两个地址之间
的
地理距离: 我希望能够转到页面,输入两个地址,单击“显示”,然后提取“按乌鸦飞
的
距离”和“按陆路运输
的
距离”值,并将它们保存到字典中。有没有办法
用
Python把数据输入到
网页
中?
浏览 2
提问于2011-08-13
得票数 8
回答已采纳
1
回答
使用Java (
HTMLUnit
)
抓取
网页
,然后将结果写入mySQL数据
库
java
、
mysql
、
html
我已经能够使用Java和
HTMLUnit
来
抓取
网页
,但是我不确定如何才能将结果数据写入到远程托管服务器上
的
MySQL数据
库
中。如果可能,我还需要定期(可能一天一次)执行此操作,而不必手动运行程序。这是可能
的
吗?关于如何做到这一点,我能否得到任何指导,无论是否彻底? 谢谢!
浏览 1
提问于2010-07-21
得票数 0
2
回答
Xpath -如何获取包含在元素之间
的
数据,而不是元素本身
java
、
html
、
xhtml
、
xpath
我正在编写一个Java程序,它从
网页
中
抓取
链接,然后将它们存储在数据
库
中。不过,我还是有点问题。使用
HTMLUnit
,我写了以下代码:它返回正确
的
锚元素,但我只需要href属性中包含
的
实际路径,而不是整个内容。如何做到这一点,以及如何获取节点之间包含
的
数据: <a href
浏览 2
提问于2010-07-22
得票数 0
回答已采纳
1
回答
有没有任何快速
的
方法来刮一个有无限滚动
的
网站?
python
、
web-scraping
我正在尝试使用python来
抓取
一个
用
无限滚动
实现
的
网站。实际上,
网络
就是pinterest。我知道如何使用selenium来
抓取
具有无限滚动
的
web。但是,WebDriver基本上模仿了访问web
的
过程,而且速度慢得多,比使用BeautifulSoup和urllib进行
抓取
要慢很多。你知道有什么时间有效
的
方法来刮一个无限滚动
的
网页
吗?谢谢。
浏览 0
提问于2014-12-29
得票数 0
回答已采纳
2
回答
如何在java中使用Http、Socks4和Socks5代理?
java
、
proxy
、
httprequest
因此,我
的
问题如下: 如果这是不可能
的
,那么我还可以使用哪些其他外部API?我是通过使用提供
的
无头浏览器来
实现
的
,但是加载甚至简单
的
网页
都需要时间,所以请您推荐给我其他API(如果有的话),这些API可以提供快速加载
网页
的
无头浏览器。我不想打开包含大量AJAX或Javascript代码
的
网页
浏览 2
提问于2010-01-16
得票数 5
回答已采纳
4
回答
屏幕
抓取
网页
,使用机械化显示数据页面
ruby
、
screen-scraping
、
paging
、
mechanize
我正在尝试屏幕
抓取
一个
网页
(使用机械化),它显示了一个网格页面的记录。我能够读取第一页中显示
的
值,但现在需要导航到下一页来读取适当
的
值。如果不是,当href是回发而不是URL时,我们怎么能有这样
的
单击操作呢?
浏览 0
提问于2009-03-21
得票数 0
3
回答
Web
抓取
只有一半
的
时间可以使用Jsoup
java
、
web-scraping
、
jsoup
我最近一直在尝试使用Java Jsoup
库
,试图更好地理解web
抓取
(从网站上提取数据)。但看起来我拼凑起来
的
代码只在部分时间内
实现
了功能。是我
的
代码有问题,还是有可能某些站点有措施来阻止web
抓取
?下面是完成所有“魔术”
的
类:import org.jsoup.*; public
浏览 1
提问于2011-08-11
得票数 0
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券