首页
学习
活动
专区
圈层
工具
发布

#测试

语言选型的新坐标:反馈确定性

张善友

另外有个隐蔽的陷阱:如果测试和实现由同一个模型生成,测试会继承实现的错误假设。 测试套件对 common-mode failure 结构性无效。解法不是写更多测...

8810

Aleph Alpha 开源 78B 参数 MoE 模型 Kolibri

YourTools

德国 AI 实验室 Aleph Alpha 在 10 月 3 日发布开源模型 Kolibri,总参数 78B,每次推理仅激活 3.46B 参数,采用 Apach...

7600

Jev 是什么?一文看懂这个"只做判断、不说话"的 AI 模型

gavin1024

除了官方数据,已经有第三方给出了独立测试。挪威开发者 Emil Lindfors 于 2026 年 9 月 18 日发布了对 Jev 的早期访问测试,用 24 ...

41410

【黄啊码】Jev 的出现,Agent 进化速度突然实现日行千里

黄啊码

文章用改 Bug 举例:先看问题、找代码、读文件、跑测试、看报错、再读文件、修改、再测试,每一步留下的文件、日志和搜索结果都会塞进 AI 的“聊天记忆”里,最后...

19410

MysticMirror 自研大模型全维度自动化测试套件(42 项用例)

王瑞MVP

本文档为 MysticMirror 自研大模型的全覆盖自动化回归测试套件,整合原有 22 项基础回归测试与 20 项新增边界能力测试,共计 42 个测试用例。全...

8110

AI 提的速被最慢那一步吃掉了:Linear 一整年 CI 优化复盘

海风自语

那篇复盘里最容易被划过去的一句,我认为最值钱:因为 agent 现在写出了他们大多数的测试,他们同步更新了各自的 agent skills,把这一性能开关纳入进...

17410

DevOps从持续开发到持续部署

静儿

因为持续交付阶段不仅交付了原有的功能,还有一些新特性,所以QA测试也建议在这个阶段进行。如果类生产环境和生产环境足够类似,还可以自动化的进行全链路的压力测试、疲...

9910

AI短剧破解产能墙,秒剧让出海从“拍一部”变“跑一批”

用户12770587

70210

腾讯云GPU算力跑AI短剧渲染:秒剧出海成本从15万打到8000

用户12770587

36110

「骂 AI 它就变聪明」,能用机制解释的只有一半

静儿

同一条道理的另一个用法是要小步。先设计、先写测试、再实现,大改拆成多轮。每一轮的分支都短,走歪了也就歪一小段。

14310

如何检验一个因子是否有效

gavin1024

因子检验是计算密集型的工作。要对全市场大量股票、很长的历史时间做 IC 计算、分层回测、多空组合、多时段稳定性测试,每检验一个因子都要跑大量计算;而因子挖掘中往...

20410

量化因子挖掘的完整流程

克劳德2048

因子挖掘是量化里计算量最大的工作之一。你要为全市场成百上千只股票、很长的历史时间、大量候选因子,反复地计算、检验、评价、回测。一轮因子测试下来,计算量非常可观;...

18710

量化交易策略优化:参数调优的正确姿势

gavin1024

正确的参数调优——尤其是稳健性测试和样本外验证——意味着你要跑大量的回测:测试一个参数区间里的每个取值、在不同的时间段验证、做滚动测试……这是相当消耗算力和时间...

19910
领券