首页
学习
活动
专区
圈层
工具
发布

#spark

Apache Spark是一个开源集群运算框架,Spark使用了存储器内运算技术,能在数据尚未写入硬盘时即在存储器内分析运算。

DataX 与 Spark 怎么选?qData 开源数据中台双执行引擎技术选型解析

吴同

随着数据平台需要接入的数据源类型和数据处理任务也在持续增多。在实际的数据集成场景中,不同任务对执行引擎的要求并不相同。

8910

Apache DolphinScheduler 任务节点实战合集:从 SQL、DataX 到 Spark、Flink 一次配置全打通

Apache DolphinScheduler

本文是一篇关于Apache DolphinScheduler 在实际项目中的应用实战笔记,包含 DolphinScheduler 执行 SQL 或存储过程、调用...

14110

腾讯云智能数据湖计算AI DLC发布会回顾:Spark+Ray一体化,面向Agent重构数据底座

腾讯云大数据

导读:当 AI Agent 从“能对话”进入“能执行任务”的生产阶段,企业数据平台面对的已不只是新增一种应用形态,而是数据形态、计算资源、训练范式和开发方式的同...

29713

大数据批处理容器化:Spark on Kubernetes 成本优化实践

克劳德2048

摘要: 将 Spark 批处理任务迁移到 Kubernetes 容器平台,可显著提升资源利用率并降低总体拥有成本。本文介绍基于 TKE 的 Spark 容器化方...

8010

腾讯云发布智能数据湖计算AI DLC 支持Spark和Ray同一平台运行

腾讯云大数据

7月25日,腾讯云正式发布智能数据湖计算平台AI DLC,面向自动驾驶、具身智能、Agent等AI场景,提供覆盖数据处理、训练、推理到 Agent 应用的一体化...

23810

DGX Spark 极限压榨!深度优化 DeepSeek-V4:35token/s、单机承载 766K 上下文多智能体服务

GPUS Lady

英伟达开发者论坛用户 entrpi 于 7 月 15 日公开一套深度适配DGX Spark(GB10 Blackwell)的 DeepSeek-V4-Flash...

68210

实战指南 | Kubernetes环境下DolphinScheduler与Spark集成

Apache DolphinScheduler

随着企业数据规模的快速增长,传统物理机或虚拟机部署Apache DolphinScheduler面临着环境配置复杂、资源利用率低、扩展性差等痛点。特别是在需要运...

14710

本地自主 AI 智能体代码迁移 :基于 NVIDIADGX Spark端到端落地实践

GPUS Lady

本文整理自 NVIDIA 线上直播讲座《DGX Spark Live: Autonomous AI Agent Migration》。本场直播携手高能效 AI ...

20110

让Spark和Ray跑在同一平台:腾讯云AI DLC即将发布

腾讯云大数据

Spark 集群跑 ETL,清洗完写到 OSS → AI 团队从 OSS 拉数据到 GPU 集群 → 做特征工程 → 训练 → 模型推回 OSS → 推理服务再...

20100

Meta Muse Spark 1.1 逼近 Opus 4.8

AI约翰

Meta 关上开源的大门 ,把全部赌注压进 Muse Spark——1款比 Claude 更便宜的 闭源模型 。

17610

Meta 重回牌桌!首个推理模型 Muse Spark 震撼发布,全面转向闭源!

AI约翰

曾几何时,Meta 是开源 AI 的坚定拥护者,Llama 系列模型一度成为全球开发者手中的利器。然而,就在今天,扎克伯格用一个重磅炸弹,彻底颠覆了所有人的认知...

19410

用 NCCL 检查 2 台 DGX Spark 协同合作

GPUS Lady

前面《 小白教程:两台 NVIDIA GB10 系统如何互联》已经带着大家用 QSFP 网线连接两台 DGX Spark 设备,本文就进一步用 NVIDIA 的...

28410

国内首个生产级Spark+Ray智能数据湖平台来了!

腾讯云大数据

传统"数据平台 + AI 平台"的两套架构,让数据在搬运中流失价值、让运维成本随规模指数增长。Agent 需要的不是更多的管道,而是一块能让数据与 AI 计算原...

30210

用QSFP连接两台DGX Spark协同工作

用户4730701

这里同样有两种方式,熟悉 SSH 的人可以自己手动处理,不熟悉的可以使用 discover-sparks 工具来处理,都很简单

42900

数据倾斜导致 Spark 作业慢?从原理到优化的完整攻略

gavin1024

摘要: Spark 作业执行缓慢,数据倾斜是常见原因。本文介绍数据倾斜的产生原理、识别方法,以及提高并行度、两阶段聚合、广播连接、 AQE 自适应执行和 RSS...

24610

快手 AB 场景提速 145 倍,从 Spark 到 Apache Doris 的加速实践

SelectDB技术团队

导读:快手 AB 指标生产场景从 Spark 切换到 Doris 提速 145 倍、资源消耗下降 72%,并刷新了 Doris 单机群最大规模:2000 节点、...

28400

XR AI重磅上线!可基于DGX Spark部署,Agentic AI解锁实时多模态XR智能交互

GPUS Lady

随着扩展现实(XR)硬件持续轻量化普及、云端实时渲染技术日趋成熟,传统XR应用的交互短板愈发凸显:以往依托指令式语音交互、固定界面触控操作的模式,无法适配虚实融...

22200

为彻底讲透 Spark 开窗,我用 Claude 自研可视化工具,全网独有逐帧拆解Frame区间

数据仓库晨曦

深耕数仓与SparkSQL开发多年,窗口函数一直是新人入门、面试高频难点。传统的 SQL 教程往往只给出一张冷冰冰的结果表,而忽略了“分组、排序、滑动窗口”的动...

12400

spark 窗口函数速查表

数据仓库晨曦

16100
领券