腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
0
回答
通过
Hive
,
如何
获取
最近
的
记录
?
hadoop
、
hive
、
bigdata
在
hive
表(地址表)中,我有上千条
记录
,许多
记录
是重复
的
,一条
记录
有我地址
的
10年前时间戳,一条
记录
在我
的
新地址上有一年前
的
时间戳,另一条
记录
在我
最近
的
地址上有今天
的
时间戳 我怎样才能得到
最近
的
地址
记录
浏览 1
提问于2016-07-12
得票数 0
1
回答
如何
获取
用于蜂窝jdbc连接
的
Yarn应用程序Id?
jdbc
、
hive
、
hadoop-yarn
下面是
如何
通过
hive
运行查询Connection = DriverManager.getConnection(CONNECTION_URL, USERNAME);ResultSet = Response.executeQuery(query); 我可以在see中看到应用程序
的
细节但是现在我想
通过
java代码获得这个作业
的
应用程序id,可以这样做吗?如果是,
浏览 4
提问于2015-11-05
得票数 2
2
回答
使用Spark SQL查询配置单元分区子目录中
的
数据
apache-spark
、
hive
、
apache-spark-sql
、
parquet
如何
强制spark sql从子目录中以递归方式
获取
以parquet格式存储
的
数据?在
Hive
中,我可以
通过
设置一些
Hive
配置来实现这一点。set
hive
.input.dir.recursive=true;set
hive
.supports.subdirectories=true; set mapred.input.dir.recursiv
浏览 28
提问于2017-02-15
得票数 3
回答已采纳
1
回答
将JAXB对象加载到Apache
Hive
/Impala
serialization
、
hadoop
、
hive
、
hdfs
、
impala
考虑一个具有多个原语和集合作为成员变量
的
复杂java (JAXB)对象。Reducer阶段将这些对象作为< K,V >对发送到HDFS中,其中K是id,V是对象
的
序列化形式(SequenceFileOutputFormat)。可以将这些java序列化对象从HDFS/本地位置加载到
Hive
/Impala吗? MongoDB能够将JAXB对象存储为现成
的
json文档。在
Hive
或Impala上实现同样
的
目标的任何帮助都是非常感谢
的
。
浏览 3
提问于2013-06-07
得票数 0
1
回答
仅当值不同时才更新HBase表
hive
、
hbase
、
apache-pig
我正在
通过
HBase
通过
Pig加载数据。pig脚本每天运行以查找各种蜂巢表中
的
更新
记录
,执行联接和处理,然后加载到HBase。我遇到
的
问题是,有时
记录
的
一部分会被更新,而其他部分则不会更新。示例:带有键abcd123
的
记录
存在于
hive
表1和
hive
表2中。在
hive
表1中,有新
的
数据,但在
hive
表2中没有。我
的
猪脚本将两个表
浏览 2
提问于2016-10-25
得票数 1
回答已采纳
1
回答
升级后与蜂巢中
的
亚稳态连接
hadoop
、
hive
最近
,我将我
的
Hive
从v1.2更新到了2.1。 使用jar:file:/opt/mapr/
hive
/
hive
-1.2/lib/
hive
-common-1.2.0-mapr-1609.jar!/
浏览 0
提问于2018-03-02
得票数 5
1
回答
Hive
中
的
查询性能问题
sql
、
azure
、
hadoop
在执行带有某些select条件
的
where语句或执行任何avg时,max(mathematical operation)查询需要2至3个小时执行。我是不是漏掉了蜂巢
的
配置。我使用
的
是微软Azure服务上
的
Hortonworks 2.5沙箱。 请给出任何解决办法。谢谢。
浏览 4
提问于2017-03-16
得票数 1
1
回答
使用sqoop更新配置单元表
mysql
、
hadoop
、
hive
、
sqoop
我正在尝试从一个MySQL数据库中取出数据,在这个数据库中,我有一个同时具有主键和last_updated字段
的
表。实际上,我正在尝试
获取
最近
更新
的
所有
记录
,并覆盖配置单元仓库中的当前
记录
sqoop job --create trainingDataUpdate -- import \ at org.apache.sqoop.Sqoop.main
浏览 0
提问于2015-02-14
得票数 0
4
回答
Hive
是
如何
存储数据
的
,SerDe是什么?
hadoop
、
hive
当查询一个表时,SerDe会将一行数据从文件中
的
字节反序列化到
Hive
内部用于对该行数据进行操作
的
对象。当执行INSERT或CTAS (请参阅第441页上
的
“导入数据”)时,表
的
SerDe将序列化
Hive
对一行数据
的
内部表示形式,这些字节被写入输出文件。 请有人把这些粗体句子解释清楚吗?我是新来
的
!!
浏览 9
提问于2013-01-30
得票数 12
回答已采纳
1
回答
如何
利用Hadoop实时处理Postgres数据库?
postgresql
、
hadoop
、
bigdata
在Hadoop中进行
的
每一个查询都应该基于Postges数据库中可能
的
最新版本。不同步是可以接受
的
,但只能延迟几分钟。
如何
在Hadoop中进行近乎实时
的
数据分析?
浏览 4
提问于2015-05-19
得票数 2
回答已采纳
1
回答
如何
通过
Nifi或sqoop使RDBMS与
Hive
保持同步,而不是创建新
的
记录
hadoop
、
hive
、
hiveql
、
apache-nifi
、
rdbms
Requirement:需要从RDBMS ( Server)
获取
1000 s
的
表,并将其推到
Hive
中,以便几乎实时地运行分析和生成报表。我在Nifi中运行了一个处理器,它经常读取我
的
Employee表,根据"lastModifiedTimeStamp“列
获取
新更新
的
记录
。现在假设
Hive
和Rdbms表是同步
的
,它们都有10条
记录
,现在我在RDBMS中更新1行,现在Nifi将读取这个新更新
的</em
浏览 1
提问于2022-07-13
得票数 0
回答已采纳
1
回答
如何
为配置单元中
的
每个disticnt id选择最新
记录
?
hive
我有一个
Hive
表,它看起来像下表 1 2300 1516187739 | Active 1当status为active时,我想
通过
查看每个ID
的
时间戳来
获取
最新
记录
。我希望每个ID只有一条
记录
。因此,结果将如下表所示。我正在寻找一种在
Hive
中实现此查询
的
有效方法。
浏览 0
提问于2018-01-17
得票数 0
回答已采纳
2
回答
在Hadoop中,
如何
在data节点上查看任务
的
类路径
hadoop
、
mapreduce
、
jvm
、
classpath
我们
的
mapreduce代码使用
hive
API。我们将包含带有-lbjars选项
的
hive
库。但是,我们
的
所有数据节点上都安装了
hive
,因此我们希望检查是否需要
通过
-libjars选项提供
hive
jars。我知道任务
的
类路径可能不包括datanode上
的
可用库,但它只从-libjars选项
获取
库,但我只想确认这一点。 然而,现在
的
挑战是
如何
检查mapredu
浏览 2
提问于2014-08-18
得票数 0
1
回答
impala.error.HiveServer2Error:重试3次失败
python-3.x
、
hive
、
impyla
、
ibis
我使用impyla和ibis来连接
hive
服务器,但我得到了错误。10000, database="yingda_test", password=None, user='admin', kerberos_service_name='None').cursor() 新
的
错误出现了
浏览 6
提问于2021-10-28
得票数 0
2
回答
有没有办法将部分表从
hive
加载到pig关系?
hive
、
apache-pig
、
hcatalog
我目前正在使用下面的代码加载一个
hive
表到pig关系。a = LOAD '
hive
_db.
hive
_table' using org.apache.
hive
.hcatalog.pig.HCatLoader(); 这一步将把
hive
表中
的
所有
记录
放入pig中,但对于我目前
的
场景,我不需要整个表都放在pig中。当我从配置单元
获取
数据时,有没有办法过滤掉不需要
的
记录
?
浏览 4
提问于2019-08-15
得票数 0
2
回答
如何
压制蜂巢警告
hive
我是蜂巢
的
新手。试图执行一个将数据输出到一个文件
的
查询。以下是我
的
查询: mapreduce.map.java.opts='-Djava.net.preferIPv4Stack=true -Xmx13107M';SET mapreduce.reduce.memory.mb= false;SET
hive
.exec.dynamic.partition=true;SET
hive
.exec.dynamic.partition.mode=nonstrict;SET
hive</em
浏览 0
提问于2019-03-14
得票数 0
回答已采纳
2
回答
新插入
的
蜂巢
记录
不显示在火花壳
的
星火会话中
apache-spark
、
hive
我运行了一个简单
的
Spark程序来
获取
数据从
Hive
到session使用spark。表中插入9条新
记录
(直接在
Hive
控制台上)。验证
Hive
表有正确插入
的
其他行。OKTime taken: 22.173 seconds, Fetched: 1 row(s)但是已经打开
的
spark会话没有显示新插入
的
9行。当插入新数据时,
Hive
表中
的
实际行数为45行,
浏览 4
提问于2019-05-24
得票数 1
回答已采纳
1
回答
从蜂巢中
获取
相同蜂箱查询
的
数据。
java
、
hadoop
、
jdbc
、
hive
我有一张有上百万张唱片
的
桌子。我希望执行一个单元查询,并希望将结果集以块
的
形式返回给客户端。就像第一个客户端请求
获取
结果一样,我希望返回第一个1000条
记录
,然后在随后
的
请求中返回下1000条
记录
,依此类推。一种方法是,在执行单元查询时
获取
完整
的
结果集,并保存它,并根据客户端
的
请求迭代结果集。但是如果我
的
结果集非常大,那么它可以在内存中保存完整
的
结果集
的
同时产生内存不足
的<
浏览 1
提问于2015-06-26
得票数 1
1
回答
如何
获取
最近
的
记录
dynamics-crm
、
dynamics-crm-2016
mscrm中有一个选项可以查看
最近
的
记录
(“计时器”按钮),我
如何
获得这个功能?或者
如何
获得
最近
的
观看
记录
?
浏览 6
提问于2021-12-27
得票数 0
回答已采纳
1
回答
如何
使用PySpark更新
hive
表中
的
记录
?
hive
、
pyspark-sql
我们正在使用spark来处理大型数据,并且
最近
获得了新
的
用例,我们需要使用spark更新
Hive
表中
的
数据。下面是一个简单
的
例子:数据驻留在
Hive
表中,应用程序使用PySpark读取数据帧(比如PySpark)。例句:数据帧在列下面。例如:加5 Add 30 32000 应用程序可以
通过
剥离Action列并附加到表中,将新数据读入第二个数据帧(例如df2)。它是笔直
的
,它
的
工作非常好。操作不可
浏览 1
提问于2019-03-29
得票数 2
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
云点播
活动推荐
运营活动
广告
关闭
领券