我从Kafka主题中获取数据,并以Deltalake(拼花)格式存储它们。我希望找到在特定的日子中获取的消息的数量。My thought :我想使用spark读取存储数据的目录,并在特定的一天使用".parquet“的文件进行计数。这会返回一个计数,但我不确定这是否正确。
这条路对吗?是否还有其他方法来计算某一天(或某段时间)从卡夫卡主题中获取的信息数量
我正在开发一个程序,在该程序中,我需要根据特定条件显示数据集中的特定行。这些条件适用于我为机器学习模型创建的features专栏。这个features列是一个向量列,当我试图通过传递一个Vector值来过滤它时,我得到了以下错误:
Exception in thread "main" java.lang.RuntimeException: Unsupported literal type class org.apache.s