暂无搜索历史
💡 一句话总结:DocClaw 的贡献不是发明新 backbone,而是把文档任务差异放到技能层、把可复用知识放到状态层、把感知动作放到工具层;技能提升质量,状...
💡 一句话总结:OmniHandwritingOCR 用 77,572 个图像-标签对、6 个子任务和 12 个子集把手写 OCR 从“总分游戏”变成失败模式诊...
💡 一句话总结:DocMemo 把长文档检索从“先选一批页再硬答”改成“读、记、更新置信度、再找”的循环;如果你做的是 RAG、文档 Agent 或多模态文档理...
💡 一句话总结:FormStruct-Bench 把表单解析从“字段抽取对了几个”推进到“结构到底坏在哪一层”;它测出最强内容分数可达 83.85%,但最佳主结...
💡 一句话总结:这篇论文把“公开基准高分但真实复杂表格仍翻车”的问题拆开诊断,再用 DEC 在不重训解析器的前提下做拆表、增强、修正和回滚;它不是万能 OCR ...
💡 一句话总结:NaviDC-OCR 证明了在文档解析这条赛道上,"针对性的数据工程 + 训练配方"比堆参数量管用——1.2B 模型四大基准全第一,还顺手赢了一...
💡 一句话总结:AutoDesign 把「围绕模型的那套系统」(prompt、工具、流程)变成可被 Agent 自动优化的对象——外层循环改系统、内层循环出作品...
💡 一句话总结:DreamX-Phi 1.0 用"把每条手臂的 3D 运动轨迹直接钉进注意力机制"的几何化方式,解决视频世界模型"画面很真、动作不听"的老毛病,...
具身智能
💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Cla...
💡 一句话总结:Grok 4.6 在智能指数上追平了 GPT-5.6 Sol(都 61 分),token 价格只有一半——但真正让人意外的是它的回合效率(完成 ...
💡 一句话总结:Meta 用 Apache 2.0 放了一个 30B、单卡能跑、冲着本地 agent 去的模型——官方跑分漂亮、生态一天内就跟上,但蒸馏来源不透...
大语言模型基本上是一摞结构几乎相同的 Transformer 层——每一层都是注意力 + MLP,参数化的方式高度一致。所以你在任意一层插 LoRA,行为都是可...
计算机视觉
💡 一句话总结:抖音搜索团队提出 DME,用"隐式 latent reasoning + 跨条件重建"两个训练期机制,让多模态嵌入在不增加推理延迟的前提下既快又...
💡 一句话总结:FlowPilot 把"预测未来看到的画面"和"生成飞行轨迹"塞进同一个生成式模型,让两条流互相参考——部署时只取轨迹、不解码画面。配合一个数学...
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市