暂无搜索历史
💡 一句话总结:把文档里的表格渲染成图、压缩到 64 个视觉 token,模型读不出具体数字,却还能准确判断"哪张表和问题相关"——爱丁堡大学团队据此设计了两段...
💡 一句话总结:这篇报告把书籍视觉元素当作一等数据对象,用轻量检测、分类、去重和可选 caption 组成可审计管线,在 Harvard Library 数亿页...
💡 一句话总结:这条管线把历史报纸从“页图加 OCR 噪声”改成 crop 级结构化数据;每个 crop 挂着文本、类型、语言、实体、主题、顺序和向量,研究者可...
💡 一句话总结:DocClaw 的贡献不是发明新 backbone,而是把文档任务差异放到技能层、把可复用知识放到状态层、把感知动作放到工具层;技能提升质量,状...
💡 一句话总结:OmniHandwritingOCR 用 77,572 个图像-标签对、6 个子任务和 12 个子集把手写 OCR 从“总分游戏”变成失败模式诊...
💡 一句话总结:DocMemo 把长文档检索从“先选一批页再硬答”改成“读、记、更新置信度、再找”的循环;如果你做的是 RAG、文档 Agent 或多模态文档理...
💡 一句话总结:FormStruct-Bench 把表单解析从“字段抽取对了几个”推进到“结构到底坏在哪一层”;它测出最强内容分数可达 83.85%,但最佳主结...
💡 一句话总结:这篇论文把“公开基准高分但真实复杂表格仍翻车”的问题拆开诊断,再用 DEC 在不重训解析器的前提下做拆表、增强、修正和回滚;它不是万能 OCR ...
💡 一句话总结:NaviDC-OCR 证明了在文档解析这条赛道上,"针对性的数据工程 + 训练配方"比堆参数量管用——1.2B 模型四大基准全第一,还顺手赢了一...
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品...
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,...
具身智能
💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Cla...
💡 一句话总结:Grok 4.6 在智能指数上追平了 GPT-5.6 Sol(都 61 分),token 价格只有一半——但真正让人意外的是它的回合效率(完成 ...
💡 一句话总结:Meta 用 Apache 2.0 放了一个 30B、单卡能跑、冲着本地 agent 去的模型——官方跑分漂亮、生态一天内就跟上,但蒸馏来源不透...
大语言模型基本上是一摞结构几乎相同的 Transformer 层——每一层都是注意力 + MLP,参数化的方式高度一致。所以你在任意一层插 LoRA,行为都是可...
计算机视觉
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市