我在Greenplum DB中有数DB的结构化数据。我需要在我的数据上运行本质上是MapReduce作业的东西。我考虑了Pivotal HD + Spark,因为我正在使用Scala,而Spark基准测试是一个令人惊叹的因素。但我认为这背后的数据存储区HDFS的效率将低于Greenplum。(请注意“我相信”。因此,为了与Greenplum存储层保持一致,我研究了Pivotal的HAWQ,它基本上是Greenplum上的</e
我正在使用ApacheHAWQ并尝试处理一些数据。我有一个主节点和两个hawq从节点。
我制作了表,插入了数据,并使用postgreSQL标识了插入的数据。我认为数据主要分布在从属上。my_db=# select gp_segment_id, count(*) from retail_demo.order_lineitems_hawq GROUP BY gp_segment_id;但是,查询语句(select gp_segment_id, count(*) from retail_demo.order_