2025.10.23
Deepseek-OCR是为了看懂,Paddle-OCR是为了看清楚。
传统的OCR追求字符级的准确率,而DeepSeek-OCR,追求的是图片压缩后回答问题的准确率。
Paddle-OCR-VL 更像似传统意义上的OCR工具,专注于文字和符号的精准。
DeepSeek-OCR通过光学压缩技术将文本信息转化为视觉模态处理,保留的OCR功能主要是为了证明“压缩没把语义弄丢”,而不是为了精确输出文字。
DeepSeek-OCR Decoder相似个“图片内容榨汁机”,而Paddel更像是“打印机”。
Deepseek OCR在处理合同文本时,即便输出文字出现“有限责任公司”简写为“有限公司”的情况,但通过视觉Token中的其他信息仍能理解其语义。这种压缩策略下,文字差异是可接受的损失。
都很好,一个能看看清,一个能看懂,两个都重要。
#DeepSeek #大模型 #agent #llm #科技趋势
内容含AI生成图片,注意甄别
广东,2025年10月23日 20:54,
相关文章
- 伟大的道理,都是反直觉的,譬如概率论概率论,被称为一门伟大的学问,在于它不仅是数学工具,更是一种颠覆人类直觉认知的思维范式。 它揭示了世界本质的不确定性,同时映照出人类认知的局…
- AI大模型反映了什么?为什么一个看似只是统计工具的概率模型能够产生类似于人类的推理能力,甚至超越人类? 这或许是由于人脑神经网络本质上也只是一个概率模型吧。AI的…
- 那啥,CoT?突然意识到 大模型不会思考 它只是个概率计算工具 所以,那啥,CoT,思维链 只是一种上下文的游戏 而已。
- Karun Pal:为什么深度思考的人会感到如此孤独?“一旦你的大脑学会了伸展, 它就再也不愿意为了舒适而缩回去。” Karun Pal 为什么深度思考的人会感到如此孤独 Karun Pal 有…