💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论...
项目介绍: 这是一个面向知识库自动化的长文档智能解析工具。支持上传 PDF、扫描件及手机拍照的标准、规范、制度、手册等长文档,可自动抽取目录结构、章节层级、表格...
💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给...
代码:https://github.com/run-llama/ExtractBench
很多人手里有一批扫描版 PDF——相机拍的、扫描仪扫的、或者老文档转成的图片型 PDF。这类文件有两个麻烦:
第一次认真考虑"作业辅导"这件事,是从研究腾讯云的一批 AI Skills 开始的。当时在系统梳理这些能力:OCR 能读图、ASR 能听声、TTS 能说话、内容...
最近,我在 Timeline Studio 中实现了实物描边能力:识别画面中的商品、鞋子、玩具等物体,并在浏览器本地生成可编辑的描边效果。