首页
学习
活动
专区
圈层
工具
发布

#ocr

Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了

用户8729876

💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论...

8310

长文档智能解析:让长文档不再停留在 OCR 文本层,而是进入可消费的数据层(附GitHub项目地址)

合合技术团队

项目介绍: 这是一个面向知识库自动化的长文档智能解析工具。支持上传 PDF、扫描件及手机拍照的标准、规范、制度、手册等长文档,可自动抽取目录结构、章节层级、表格...

11310

用 WorkBuddy 打造高中数学试卷的高精度校对流水线 #WorkBuddy#

用户12669764

13200

做文档解析的人该看看 Infinity-Parser2:一个模型把版面、表格、公式、图表全端了

用户8729876

💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给...

11910

阅读笔记:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

用户8729876

代码:https://github.com/run-llama/ExtractBench

8700

用 WorkBuddy 把扫描版 PDF 批量本地 OCR 提取(零 token 消耗)

用户12657961

很多人手里有一批扫描版 PDF——相机拍的、扫描仪扫的、或者老文档转成的图片型 PDF。这类文件有两个麻烦:

20810

腾讯云 AI Skills + WorkBuddy,打造 AI 伴学助手

悟空码字

第一次认真考虑"作业辅导"这件事,是从研究腾讯云的一批 AI Skills 开始的。当时在系统梳理这些能力:OCR 能读图、ASR 能听声、TTS 能说话、内容...

1K2116

纯浏览器实现实物描边:NanoDet + MagicTouch 本地推理实践

用户5557817

最近,我在 Timeline Studio 中实现了实物描边能力:识别画面中的商品、鞋子、玩具等物体,并在浏览器本地生成可编辑的描边效果。

12810
领券