GPT-5还没影,我已经把多模态推理的架构改了两轮
上周五组里开会,leader提了一嘴OpenAI CEO说2026年可能出新一代模型,具备多模态深度推理能力。当时我就在备忘录上记了几个词,结果今天翻出来一看,发现自己上个月已经把这套架构改了两遍了。
有意思的是,我改的不是什么大工程,就是接口适配层。
为什么提前改
说实话,一开始我也觉得"又来这套"。每年都有人喊下一代模型要颠覆一切,结果呢?GPT-4.5没出,GPT-4o出来了,然后又是GPT-4.5omini。等到真到GPT-5的时候,可能又变成GPT-4.5pro之类的中间形态。
但我同事老张说了一句让我印象挺深的话:与其等模型出来再适配,不如先把接口设计好。反正接口层抽象好了,换模型就是改配置的事。
我当时没太在意,结果上个月改代码的时候才发现,老张是对的。
改了两轮的事
第一轮改,是在三月初。我把原来的文本处理管道拆成了独立的stage,每个stage可以单独替换实现。这样如果新模型对输入格式有特殊要求,我只需要加一个新的stage,不用动整个管道。
改完之后,我发现一个问题:多模态的输入处理逻辑太分散了。图片、音频、文本的处理散落在不同地方,耦合得很严重。
第二轮改,就是把多模态输入统一收敛到一个handler里。这个handler负责路由到不同的处理模块,然后根据模型的能力动态选择处理策略。比如GPT-4o支持图片输入,我就走图片处理路径;如果是纯文本模型,就直接跳过。
改完之后测试了一下,接口层的延迟从原来的15ms降到了3ms。主要是减少了不必要的重复解析。
成本预估的坑
说到成本,这才是真正让人头疼的事。
我现在用的是GPT-4o-mini,API价格是每百万tokens $0.15。团队内部算了一笔账,如果GPT-5真的具备多模态深度推理能力,价格大概率会贵不少。保守估计至少是GPT-4o的2-3倍。
但我发现一个现象:大家讨论的时候,往往只算输入成本,忽略了输出成本。特别是多模态场景,输出可能是结构化的JSON,也可能是自然语言描述,价格差异很大。
上个月我让运维导了三个月的API调用日志,发现一个反直觉的数据:我们70%的调用量,其实是在处理图片输入。但图片输入的价格是文本输入的10倍左右。也就是说,如果GPT-5真的支持多模态推理,我们的成本可能会翻5-6倍。
我当时的反应是:先做个降级方案。当模型返回的tokens数量超过阈值时,自动切换到更便宜的模型。这个阈值现在定的是4096tokens,超过就切到GPT-4o-mini。
还没定论的事
其实到现在,我对GPT-5的能力预估还是有点模糊。OpenAI那边没有官方信息,网上全是猜测。我最近看了几个技术博客,有人预测GPT-5会用新的架构,不再是纯Transformer。也有人预测会加入更多的推理能力,比如类似o1的链式思考。
但我更关心的是实际落地的问题。比如,我们的多模态pipeline,能不能支持GPT-5的输入格式?现在的handler设计,能不能快速适配新模型的能力?成本模型,能不能承受新的定价?
这些问题,我现在还在写代码的过程中一点点解决。
一个还没想明白的事
上周有个需求,要把历史图片数据迁移到新模型处理。我算了一下,如果直接用GPT-4o处理,大概要3000多刀。如果等GPT-5出来,可能价格更高,也可能有优化。
现在我就卡在这里:是现在就迁移,还是等一等?
我觉得这可能是个普遍问题。很多人都在等"更好的模型",但更好的模型到底什么时候来,没人知道。就算来了,价格可能更贵,兼容性可能更差。
你们遇到这种情况是怎么处理的?是直接上,还是等?
你在实际项目中有踩过类似的坑吗?或者有更好的解决方案?欢迎在评论区分享你的经验。