首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >#WorkBuddy# 实战:一句话搭起每日数据复盘流水线,自动产出 6 份分析报告——附 5 个数据坑

#WorkBuddy# 实战:一句话搭起每日数据复盘流水线,自动产出 6 份分析报告——附 5 个数据坑

原创
作者头像
来者何人
发布于 2026-09-28 17:18:04
发布于 2026-09-28 17:18:04
210
举报

本文是数据分析与工程实践的分享,示例数据均做脱敏与抽象化处理。

一、痛点:每天重复的数据复盘,三个死结

我每天要处理一批全市场高频时序数据(价格 + 成交量 + 分时),做成一份结构化复盘。以前纯手工要花两三个小时,而且绕不开三个死结:

  1. 二手聚合数据不可信。第三方榜单里的“连续 N 日”“涨幅榜”这类口径,经常和原始数据对不上——我实际核对过一处:榜单写“连续 3 日触限”,用日 K 回算当天其实是冲高回落收 +4.17%,根本没触及上限价。凡是别人算好的口径,都要用原始数据回算验证一遍。
  2. 只看单一筛选视角会漏样本。我原先只盯“收盘价等于当日上限价”的那批样本,后来补扫才发现,当天成交额最大的几只(其中一只 63 亿)根本没进这个池子——它们是“最高价触及上限价但收盘未守住”。筛选口径一旦单一,最大的信号恰好落在视野外。
  3. 指标之间互相打架,没有验证就是玄学。成交量、换手率、封单厚度、大单净流入——这几个指标经常给出相反结论。不做回测,就只能凭感觉挑一个信。

后来我把整套流程搬进 WorkBuddy:一句话下达任务,AI 自己拉数据、自己写脚本、自己纠错、自己生成 HTML 报告。这篇文章记录完整做法和我踩过的坑。

二、总体工作流:一次对话,六份报告

整条流水线在一个 WorkBuddy 任务里跑完,输出结构是这样:

代码语言:bash
复制
全市场扫描(自算样本池,含不同涨跌幅限制的品种)
   ├→ 报告① 总览:分层结构 + 当日整体温度定位
   ├→ 报告② 明细拆解:逐个样本的资金过程还原
   ├→ 报告③ 关联分析:实体(账户/交易单元)之间的联动关系
   ├→ 报告④ 补盲扫描:被主口径漏掉的高波动品种
   ├→ 报告⑤ 专题归因:单一主题深挖(样本密度 + 时间序)
   └→ 报告⑥ 回测验证:前一日信号 → 次日表现的统计检验

每份报告都是单文件自包含 HTML(纯内联样式、无外链),双击即开,也可以起个本地 HTTP 服务在内置浏览器里看。

三、分步实操

第 1 步:全市场扫描,自算样本池

核心指令思路:「扫描全市场数据,自行回算每个样本的连续触限天数、触限时间、回落次数,输出结构化 JSON」。

关键原则是不信任何现成的聚合榜单——全部用本地日 K 自算。这一步的价值在上一节已经体现:我靠它纠正了第三方榜单的两处口径错误。

另外要注意不同品种的涨跌幅限制不一样(主板 10%、创业板/科创板 20%、北交所 30%),扫描逻辑必须分市场处理,否则高波动品种会被整体漏掉——而这批品种恰恰是波动最剧烈、信息量最大的样本。

第 2 步:明细拆解——一个样本的资金过程还原

用分时逐分钟数据,把一个样本的触限过程拆成四个口径:上行段用了多少量能、触限后被动成交多少、大单净投入多少、收盘时挂单有多厚。

这一步挖出了一个反直觉结论:某低价样本“挂单股数全场第一”,听起来最强,但换算成金额只占当天成交额的 16.7%;真正的触限质量第一是另一个 09:31 即触限、量比 0.4 的样本。结论:绝对股数排名没有意义,必须看金额相对成交额的比例。

第 3 步:关联分析——实体联动追踪

把“交易单元 → 样本”的原始明细聚合成联动实体(同一实体买入 ≥2 个不同主题的样本),再比对买方实体交集,就能判断“资金从主题 A 流向主题 B”到底是同一批钱在倒手,还是只是主题层面的轮动。我查过一组跨三日的实体交集:交集为零,证明所谓“资金转移”其实是两批完全不同的钱——这个结论直接推翻了我上一版报告的表述。

第 4 步:专题归因 + 补盲

选定一个主题后,按固定流程深挖:样本密度 → 触限时间确定带动关系 → 标签归属纠偏 → 涨幅 3%~9.5% 的补涨候选池。触限时间这一步挖出一条经验规律:最早触限的“先锋”往往不是核心样本,核心看资金厚度——有一个样本排第 6 个触限,但成交额是第 2 名的 2 倍、四路资金齐聚,才是真正的核心。

第 5 步:回测验证

把前一日所有样本的资金指标和次日实际表现做相关性分析。这一步推翻了我自己的结论(详见坑 1)。

四、踩坑记录

坑 1:接口调用忘传日期参数 = 未来函数

我的脚本一开始调资金流接口没传 --date,接口默认返回最新交易日。等于“用今天的数据解释今天的表现”,算出来的“大单参与度强预测 r=+0.436”全是虚假相关。

修复后重跑,真实结果是:大单净流入与次日表现负相关(r=-0.211)——净流入越大,次日反而越弱。

⚠️ 这是本文最重要的一条:回测类脚本,每个数据接口调用都必须显式传日期参数,并在脚本里加“数据日期匹配校验”,否则你拿到的是一份看起来完美、实则全错的相关性报告。 修复前后结论完全相反。

fig1
fig1

图 1:脚本修复片段——所有数据接口显式传日期参数,并对返回体做日期校验(见坑 1)

坑 2:分钟数据的 volume/amount 是当日累计值

直接累加会得出“拉升段 20 亿 > 全天 9.44 亿”的荒谬结果,而且程序不报错,静默出错。必须做差分。

校验方法:末条 amount / volume / 100 应该等于报价接口返回的均价,对得上才算数。

fig2
fig2

图 2:明细拆解核心逻辑——分钟数据按日分组差分 + 均价交叉自检(见坑 2)

坑 3:字段名和代码前缀想当然

数据接口返回的涨幅字段是 change_percent 而不是 chg;不同市场代码前缀是 sz30 / sh688 / bj,而不是裸的 300/688/83。两处想当然,导致我的高波动品种扫描第一版跑出 0 个结果——看起来像“当天没有符合条件的数据”,实际是字段取错了。

坑 4:市值单位是元,不是亿元

8489000000 = 84.89 亿元。单位搞反,所有“按流通市值归一化”的指标结论会整体反向(省力/费力、集中/分散全反过来)。

坑 5:标签 ≠ 真实驱动

数据结构里的概念标签经常与实际驱动不符:某白酒类样本挂着“乡村振兴”标签,真实驱动是它自己的业绩线;某个名字里带“统一”字样的样本,实际是央企背景的液冷业务。每个专题都必须做标签归属纠偏,否则归因整段是错的。

五、效果

一次完整任务,WorkBuddy 交付:

  • 6 份 HTML 报告(总览/明细拆解/关联分析/补盲/专题归因/回测验证),全部单文件自包含,可直接分享;
  • 1 份分组清单文件(按真实主题分组 + 代码),结构化输出便于二次使用;
  • 纠正第三方榜单 2 处错误、推翻自己 3 处误判(其中换手率对比直接把两个原定候选样本降级剔除);
  • 沉淀 10+ 个可复用脚本,第二天的分析直接增量跑。
fig3
fig3

图 3:一次任务沉淀的 6 份报告产物(单文件自包含 HTML)

最值钱的不是报告本身,而是它敢用回测数据推翻我自己的直觉——净流入是反向指标、换手率必须绑定位置解读、挂单股数排名无意义,这些结论没有一个是我凭经验直觉能得出的。

六、总结

三条经验送给想复刻这套流程的人:

  1. 让 AI 自算,别喂它二手数据。数据源错误会在下游无限放大,宁可慢也要回算验证。
  2. 每个接口调用都带日期参数。回测类任务先查未来函数,这是生死线。
  3. 让 AI 输出可证伪的结论(相关系数、分组胜率),而不是描述性罗列——被数据推翻的结论,比被数据证实的结论更有用。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、痛点:每天重复的数据复盘,三个死结
  • 二、总体工作流:一次对话,六份报告
  • 三、分步实操
    • 第 1 步:全市场扫描,自算样本池
    • 第 2 步:明细拆解——一个样本的资金过程还原
    • 第 3 步:关联分析——实体联动追踪
    • 第 4 步:专题归因 + 补盲
    • 第 5 步:回测验证
  • 四、踩坑记录
    • 坑 1:接口调用忘传日期参数 = 未来函数
    • 坑 2:分钟数据的 volume/amount 是当日累计值
    • 坑 3:字段名和代码前缀想当然
    • 坑 4:市值单位是元,不是亿元
    • 坑 5:标签 ≠ 真实驱动
  • 五、效果
  • 六、总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档