例如,假设我有10,000个要对其进行aggregate()处理的排序文档。但我想把它们分成四分位数:前25%,25% - 50%,50% - 75%,最低25%。在一个管道中是否存在这样的方法,而不是每个四分位数必须执行4个单独的管道?aggregate()- Run other pipeline commands谢谢!
我正在尝试用java语言在hadoop-1.0.1中实现K means。我现在很沮丧。虽然我得到了k means的完整实现的链接,但作为Hadoop的新手,我想学习它而不是复制别人的代码。我对map和中可用的reduce函数有基本的了解。有人能给我提供实现k means mapper和reducer类的想法吗?它需要迭代吗?