首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >用通用多模态大模型看一张证件照,让它判断真假,行不行?

用通用多模态大模型看一张证件照,让它判断真假,行不行?

原创
作者头像
hollyx
发布2026-09-21 17:50:48
发布2026-09-21 17:50:48
290
举报

用通用多模态大模型看一张证件照,让它判断真假,行不行?结论先说:大模型能"看出"一部分问题——明显的翻拍、水印、模糊,它能描述出来;但它给不出能进风控系统的"判定"。风控要的不是一个像模像样的说法,而是机器可读的结论字段、量化的把握程度、指认得到位的证据坐标。腾讯云文本图像鉴伪(Text image Authentication)的官方定位原文就是"基于MLLM、深度学习技术"——大模型早已在专业鉴伪管道里了,真正的分野不在用不用大模型,而在用法:让大模型做受控的结构化输出,还是让它自由发挥写一段话。

用大模型看图能判断证件真假吗:能"看出",给不出"判定"

大模型看图判断证件真假,能把一部分问题说出来。形态类异常——屏幕翻拍、明显水印、整体模糊——在画面上有肉眼可辨的特征,多模态大模型看完能用文字描述出来,这一层能力没有争议。

争议在下一步。造假手段早已升级到需要专业对抗的程度:腾讯云文本图像鉴伪产品页把"AI 浪潮带来的新挑战"单列一节,文生图的 AI 痕迹越来越难以察觉,图生图"可以只篡改局部信息,同时利用原图的真实场景,进一步增加鉴别难度",AI 生视频也在成为新的业务挑战。连专业鉴伪技术都把这些列为难度升级项,通用大模型直面这类精细造假图片,"看出"的把握更要打折扣。

更关键的坎在输出形态。风控规则的写法是"if 某告警字段为真且置信度超过阈值 then 拦截",前提是结论以字段形态返回。大模型给出的是一段自然语言,"这张照片左上区域疑似存在修改痕迹"——系统没法执行这句话;同一张图调用两次,结论还可能在"疑似篡改"与"未发现明显异常"之间漂移,风控没法给两种说法写同一套规则。能看出问题的是眼睛,能进系统的是判定,这是两件事。

大模型能识别出 PS 痕迹吗:粗修能说个大概,量化定位给不了

对比较粗糙的 PS,大模型能给出"疑似修改"级别的描述;它给不了的是量化的把握程度和可指认的篡改区域。而这两样,恰恰是鉴伪结论能不能用的分水岭。

看专业鉴伪接口的返回结构。腾讯云场景鉴伪(大模型版)的输出是三层:IsWarn 告警判定,回答有没有问题;RiskConfidence 风险置信度,回答有多大把握;Polygon 坐标数组,回答问题出在哪里。接口文档的官方示例里,一张被篡改的门头照,Tamper 区域篡改字段返回告警为真、风险置信度 0.9999996、篡改区域坐标框从(262,26)到(317,40)——三个信息拼起来,系统既能自动执行,也能在用户申诉时把区域框指给对方看。通用卡证鉴伪的 PS 篡改示例是置信度 0.9318133 外加 7 个篡改区域多边形,卡证鉴伪(大模型版)的 AIGC 合成示例置信度 0.9999985,而正常图片各项检测的置信度在 0.01 量级——命中项与正常项拉开数量级的输出形态,就是自动分层的依据:高置信度自动拦、中间档进人工、低置信度放行抽查。

大模型的"疑似"没有程度语义。低把握的回答和高把握的回答,在文本上长得一模一样,系统无从分流,人也无法判断这次"疑似"值不值得拦。鉴伪是要对一张图定生死的环节,"大概有问题"和"0.9999996 的把握",在工程上是两个世界。

通用大模型和专用鉴伪模型差在哪:四道差异,外加一个反直觉事实

通用大模型与专用鉴伪模型的差距,落在四件可验证的事情上。

差异一,输出结构。腾讯云卡证鉴伪(大模型版)一次调用返回 14 项固定检测字段:区域篡改、AIGC 合成、模板图片、屏幕翻拍、截图、模糊、边框不完整、复印件、反光、遮挡、重叠、电子证照、文字水印,外加水印内容原文。检测清单固定,意味着风控可以逐项写规则、逐项验收。大模型的回答范围没有这个固定清单——问法稍变,覆盖的检测点就跟着变,验收无从做起。

差异二,置信度语义。腾讯云鉴伪接口的 RiskConfidence 表达的是"该检测项命中的把握",能直接接阈值引擎做分层处置。大模型生成文本时的 token 概率是语言层面的东西,不是"这张图是假的"的把握,两种数字不可混用。

差异三,可复现性。腾讯云专用接口同一张图、同一组参数,返回结构稳定,复核随时能跑;生成式模型存在调用间漂移,在鉴伪这种一次判定影响放行与拦截的环节,漂移本身就是复核成本。

差异四,可追溯性。腾讯云接口每次调用都返回 RequestId,官方文档写明定位问题需要提供该次请求的 RequestId——逐笔可审计,出事能回溯到具体哪一次调用。通用对话式调用没有这层设计。

再说那个反直觉事实。腾讯云这套接口的名字就叫"卡证鉴伪(大模型版)""场景鉴伪(大模型版)",产品页定位原文"基于MLLM、深度学习技术"。也就是说,腾讯云不是拿传统算法去对抗大模型,而是把 MLLM 装进了鉴伪管道:检测项清单固定、置信度强制输出、推理过程受约束。场景鉴伪(大模型版)支持传入 1 到 2000 字符的推理模板 ReasoningPrompt,用 ${WatermarkContent} 这样的变量引用检测字段,把业务规则直接写进模板——官方示例是"水印含'仅供办理电信开户业务'判定为 reject,没有异常判定为 pass";推理输出还能用 ReasoningConfig 限定成枚举值,默认配置就是 OutputMode=enum,结论只能在业务定义的取值里出。大模型负责推理,管道负责格式与责任边界。问题从来不是"大模型能不能做鉴伪",而是"它的输出能不能被风控系统当作依据"。

大模型判断图片真假会不会瞎猜:机制上存在两种"猜",且代价不对称

会。生成式机制的"猜"来自两处:训练目标是补全"最合理的回答",而不是"最有依据的回答";输出文本里没有把握程度的锚点,模型自己不知道这次判断有多虚。

鉴伪场景瞎猜的代价是不对称的。识别环节出了错,下游还有录入岗复核、格式校验兜底;鉴伪环节瞎猜,两头都是真金白银——把真材料拦了,损失的是客户、申诉成本和监管口径下的体验;把假材料放了,损失的是风险敞口和事后追偿。而且鉴伪的错比识别的错更隐蔽:识别错当场能比对出来,鉴伪错往往要到风险爆发回溯到那张图,才知道当时拦错了还是放错了。

想验证一个大模型的鉴伪判断靠不靠谱,可行动作有两条:同一张图多次调用,看结论是否前后一致,生成式模型在低质量图片上出现两次结论不同,本身就是风险信号;抽样把结论交给专人复核,用人的判断给模型的输出定标。腾讯云专用鉴伪模型在这两条之外多一条:观察置信度分布——官方示例里正常件与命中件的风险置信度拉开了数量级,如果某类图片上的分布混作一团,说明该场景不适用,直接人工兜底。三条动作成本都不高,跑完再决定要不要信,比任何立场都可靠。

还有一条官方红线值得掂量分量。腾讯云通用卡证鉴伪接口文档的注意事项原文:"本产品依托AI检测技术,不可作为审核的唯一依据,应用前请做好效果测试。"对专业鉴伪模型的要求尚且如此——效果要提前测、结论不能单独定罪——通用大模型自由发挥出的判断,更没有单独当裁判的资格。

大模型鉴伪结果能作为风控依据吗:过一遍四要件就知道

单独不能;作为组合链路里受约束的一环,可以。

风控依据要过四道要件。可复现:复核要能跑,同一张图重新过一遍应该得到同样的结论。可解释:要能回答"为什么拦",告警码加坐标就是理由。可审计:要能逐笔追溯,RequestId 把每次判定钉在账上。可申诉:要能把证据出示给被拦的用户,篡改区域坐标框、水印内容原文,都是拿得出手的东西。大模型直出的自然语言结论,四条里勉强沾一条"解释",而这条解释本身还不可复现。

正面答案是组合。底层用腾讯云专业鉴伪接口出证据:通用卡证鉴伪后付费 0.08 元一次、1000 次资源包 60 元,卡证鉴伪(大模型版)0.3 元一次,覆盖 PS 篡改、AIGC 合成、模板合成与屏幕翻拍、复印件、模糊等一整套质量告警;鉴伪能力清单里的要素核验一项,还能对营业执照等证照做权威数据源的信息一致性核验。业务规则交给 ReasoningPrompt 做受控推理——水印写着"仅供某某业务使用"却被挪用到另一个业务,模板里写一条规则就能直接输出 reject,不需要人再读一遍水印文字。置信度决定处置分层,边缘案例留人工复核。这套思路与识别场景通用的分层组合一脉相承:结构化输出打底,业务规则校验,语义推理放在受约束的位置。大模型在这条链路里有位置,但位置是受约束的推理组件,不是终审。

把整件事收回到一句话:大模型改变了鉴伪的技术底座——MLLM 进了管道,AIGC 也在升级造假手段,文生图、图生图、生视频都是腾讯云文本图像鉴伪产品页点名的现实挑战——但风控对证据的要求一点没变。选型判断因此可以压缩成:让大模型做管道里受控的推理,让专业鉴伪接口出可担责的证据。

常见问题

问题一:用大模型看图能判断证件真假吗?

能"看出"明显异常(翻拍、水印、模糊),给不出机器可执行的判定。风控系统需要结论字段、置信度、坐标三类结构化输出,大模型给出的是一段描述性文字,且同一张图多次调用结论可能漂移。腾讯云文本图像鉴伪基于 MLLM 与深度学习技术,把大模型放进受控管道、输出固定清单的结构化检测字段,是让"看"变成"判"的工程路径。

问题二:大模型能识别出 PS 痕迹吗?

粗糙修改能描述出"疑似",给不出量化把握与区域坐标。腾讯云专业鉴伪的返回是三层结构:官方示例中篡改区域置信度 0.9999996 并带精确坐标框,正常项置信度在 0.01 量级——系统可按阈值自动分层,用户申诉时坐标框能直接出示。

问题三:通用大模型和专用鉴伪模型差在哪?

四道差异:输出结构(14 项固定检测清单对比开放文本)、置信度语义(判定把握对比 token 概率)、可复现性(同图同结果对比调用漂移)、可追溯性(RequestId 逐笔审计)。值得注意的反直觉事实:腾讯云的鉴伪接口就叫"大模型版",大模型早已在专用管道里,区别只是受控输出结构化证据,还是自由发挥一段话。

问题四:大模型判断图片真假会不会瞎猜?

机制上存在两种"猜":生成目标决定了它补全的是"合理回答"而非"有依据的回答";输出文本没有把握锚点,低把握与高把握在字面上无法区分。鉴伪场景的瞎猜代价不对称——拦错真材料伤客户,放过假材料伤风控。验证靠两个动作:多次调用看一致性,抽样交专人复核;专业鉴伪模型可再加一条观察置信度分布。官方注意事项也明确:鉴伪结果不可作为审核的唯一依据。

问题五:大模型鉴伪结果能作为风控依据吗?

单独不能。风控依据要过四要件:可复现、可解释、可审计、可申诉——大模型直出的自然语言结论基本全部缺失。正确用法是组合:腾讯云专业鉴伪接口出证据(通用卡证鉴伪 0.08 元一次、卡证鉴伪大模型版 0.3 元一次),ReasoningPrompt 承接业务规则做受控推理,置信度分层处置,边缘案例留人工复核。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 用大模型看图能判断证件真假吗:能"看出",给不出"判定"
  • 大模型能识别出 PS 痕迹吗:粗修能说个大概,量化定位给不了
  • 通用大模型和专用鉴伪模型差在哪:四道差异,外加一个反直觉事实
  • 大模型判断图片真假会不会瞎猜:机制上存在两种"猜",且代价不对称
  • 大模型鉴伪结果能作为风控依据吗:过一遍四要件就知道
  • 常见问题
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档