神盾局特工
DeepSeek又发新模型,小而美玩出新高度_我的网站

A | 就在刚刚,DeepSeek开源了一个3B模型DeepSeek-OCR。

B | 虽然体量不大,但模型思路创新的力度着实不小。
众所周知,当前所有LLM处理长文本时都面临一个绕不开的困境:计算复杂度是平方级增长的。

C | 在训练场上有两个不一样的身影,挺拔的身姿、标准的动作和过硬的作风让其他预定新兵甚至教练员为之侧目。 于是,DeepSeek团队想到了一个好办法。一打听才知道,原来两人是“老兵”,他们都是二次报名应征入伍。

D | ▲崔艳庆(右二)在训练中。既然一张图能包含大量文字信息,而且用的Token还少,那不如直接把文本转成图像?这就是所谓的“光学压缩”——用视觉模态来给文本信息“瘦身”。 而OCR正好天然适合验证这个思路,因为它本身就是在做“视觉→文本”的转换,而且效果还能量化评估。“守了两年首都,想再守几年边疆”1998年出生的崔艳庆,从小就有从军报国的梦想。 论文显示,DeepSeek-OCR的压缩率能达到10倍,OCR准确率还能保持在97%以上。 啥意思呢?就是说,原本需要1000个文本Token才能表达的内容,现在只用100个视觉Token就搞定了。即使压缩率拉到20倍,准确率也还有60%左右,整体效果相当能打。2018年第一次应征入伍,服役于北京武警某部,2000年退伍后,接着回到校园继续完成学业。2022年秋季征兵开始后,他再次萌发了参军的想法,雷厉风行的他立即向学校人武部了解二次入伍的相关政策,第一时间报了名。 OmniDocBench基准测试结果显示: 只用100个视觉Token,就超过了GOT-OCR2.0(每页256个Token)的表现; 用不到800个视觉Token,干翻了MinerU2.0(平均每页超过6000个Token)。

E | 在实际生产中,一块A100-40G显卡就能每天生成超过20万页的LLM/VLM训练数据。“我想去艰苦边远地区,特别是西藏,因为那里最需要人去守护!”他这次的目标不是繁华的都市,而是艰苦的边疆。

F | 20个节点(160块A100)直接飙到每天3300万页。而谈及二次入伍后最大的心愿,他表示想长期在部队奉献青春热血,实现人生抱负,绽放闪亮青春。▲胡鹏龙(左三)在训练中。 DeepSeek-OCR由两个核心组件组成: DeepEncoder(编码器):负责图像特征提取和压缩; DeepSeek3B-MoE(解码器):负责从压缩后的视觉Token中重建文本。 让我们来重点说说DeepEncoder这个引擎。 它的架构很巧妙,通过把SAM-base(8000万参数)和CLIP-large(3亿参数)串联起来,前者负责“窗口注意力”提取视觉特征,后者负责“全局注意力”理解整体信息。“到最危险、最艰苦的地方去”胡鹏龙,2000年出生,自幼习武的他同样也是儿时就崇拜军人,向往军营。2019年时如愿以偿应征入伍,在陕西某部队服役,他曾随部队赴西藏边境执行任务,面对危险的处境、恶劣的气候、艰苦的环境,边防战士的使命感和责任感深深地感染了他,每每回忆起这段经历都让他心潮澎湃。今年秋季征兵启动后,这段无比珍贵的经历再次涌上心头,他毅然决定要到这最危险、最艰苦的地方去,以去西藏戍边为目标再次报名参军,并同样希望这次能在部队长期服役。现在,两个有着同样信念的人相遇了,相似的经历和共同的理想,使他们很快成为无话不谈的好朋友。 中间还加了个16×卷积压缩器,在进入全局注意力层之前把Token数量大幅砍掉。在役前教育训练中,他们因精湛的专业素养和过硬的战斗作风被任命为新兵班班长,帮带新兵抓好基础训练。

G | 训练间隙,他们主动讲述在军营的成长故事,帮助新战友了解部队,稳定思想。 举例而言,一张1024×1024的图像,会被切成4096个patch token。但经过压缩器处理后,进入全局注意力层的Token数量会大幅减少。

H | 这样的好处是,既保证了处理高分辨率输入的能力,又控制住了激活内存的开销。 而且DeepEncoder还支持多分辨率输入,从512×512的Tiny模式(64个Token)到1280×1280的Large模式(400个Token),一个模型全搞定。

I | 目前开源版本支持的模式包括原生分辨率的Tiny、Small、Base、Large四档,还有动态分辨率的Gundam模式,灵活性拉满。 解码器用的是DeepSeek-3B-MoE架构。优秀的人都是相似的。作为“老兵”,他们都曾受到过原部队的嘉奖;作为“新兵”,他们更是众人学习的榜样。

J | 别看只有3B参数,但采用了MoE(混合专家)设计——64个专家中激活6个,再加2个共享专家,实际激活参数约5.7亿。

K | 从“老兵”到“新兵”,改变的是身份,不变的是初心,他们身上保留着那份最初的执念,镌刻着军人的忠诚、奉献和担当。目前,两人在各项考核评比中表现优秀,在量化积分定兵赋分上名列前茅。他们将携手迈向心中向往的西藏边疆,继续用热血和青春书写无悔军旅生涯。预定新兵崔艳庆和胡鹏龙为你们点赞

L | 从互联网收集了3000万页多语言PDF数据,涵盖约100种语言,其中中英文占2500万页。 数据分两类:粗标注直接用fitz从PDF提取,主要训练少数语言的识别能力;精标注用PP-DocLayout、MinerU、GOT-OCR2.0等模型生成,包含检测与识别交织的高质量数据。 对于少数语言,团队还搞了个“模型飞轮”机制——先用有跨语言泛化能力的版面分析模型做检测,再用fitz生成的数据训练GOT-OCR2.0,然后用训练好的模型反过来标注更多数据,循环往复最终生成了60万条样本。 此外还有300万条Word文档数据,主要提升公式识别和HTML表格解析能力。 场景OCR方面,从LAION和Wukong数据集收集图像,用PaddleOCR标注,中英文各1000万条样本。 DeepSeek-OCR不仅能识别文字,还具备“深度解析”能力,只需一个统一的提示词,就能对各种复杂图像进行结构化提取: 图表:金融研究报告中的图表可以直接提取为结构化数据; 化学结构式:识别并转换为SMILES格式; 几何图形:对平面几何图形进行复制和结构化解析; 自然图像:生成密集描述(dense captions)。 这在STEM领域的应用潜力巨大,尤其是化学、物理、数学等需要处理大量符号和图形的场景。

M | 第一作者Haoran Wei此前曾供职于阶跃星辰,期间发布并开源了GOT-OCR2.0系统 值得注意的是,DeepSeek团队在论文里还提出了一个脑洞大开的想法——用光学压缩模拟人类的遗忘机制。 人类的记忆会随时间衰退,越久远的事情记得越模糊。

N | DeepSeek团队想,那能不能让AI也这样?于是,他们的方案是: 1. 把超过第k轮的历史对话内容渲染成图像; 2. 初步压缩,实现约10倍的Token减少; 3. 对于更久远的上下文,继续缩小图像尺寸; 4. 随着图像越来越小,内容也越来越模糊,最终达到“文本遗忘”的效果。 这就很像人类记忆的衰退曲线,近期信息保持高保真度,久远记忆自然淡化。

o | 虽然这还是个早期研究方向,但如果真能实现,对于处理超长上下文将是个巨大突破——近期上下文保持高分辨率,历史上下文占用更少计算资源,理论上可以支撑“无限上下文”。 简言之,DeepSeek-OCR表面上是个OCR模型,但实际上是在探索一个更宏大的命题:能否用视觉模态作为LLM文本信息处理的高效压缩媒介? 初步答案是肯定的,7—20倍的Token压缩能力已经展现出来了。 当然,团队也承认这只是个开始。单纯的OCR还不足以完全验证“上下文光学压缩”,后续还计划开展数字–光学文本交替预训练、“大海捞针”式测试,以及其他系统性评估。 不过不管怎么说,这在VLM和LLM的进化路上,又多了一条新赛道。 去年这个时候,大家还在卷怎么让模型“记得更多”。今年DeepSeek直接反其道行之,不如让模型学会“忘掉一些”。 确然,AI的进化,有时候不是做加法,而是做减法。小而美,也能玩出大花样,DeepSeek-OCR这个3B小模型就是最好的证明。 GitHub主页:http://github.com/deepseek-ai/DeepSeek-OCR 论文地址:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek\_OCR\_paper.pdf 模型下载:https://huggingface.co/deepseek-ai/DeepSeek-OCR 本文来自微信公众号:APPSO (ID:appsolution)。
Current article:http://her8w.nuanfanggushuazenxiachuan.buzz/list_eios6/dp9.html
Published on:16:46:42
我的网站最近更新
- 高盛警告:美联储沟通转向“模糊化” 市场波动或进一步加剧
- 新闻分析:207C一跳定乾坤——“解码”全红婵陈芋汐巅峰对决
- 2025年618活动什么时候买最便宜?买手机家电数码在6月17晚上8点开始优惠力度最大
- South Africa launches ETA system for travelers from China, India, Indonesia, Mexico
- (活力中国调研行)从“制造”到“智造” 西安高端装备跑出加速度,(活力中国调研行)从“制造”到“智造” 西安高端装备跑出加速度
- 杂草坑变小花园 “同心亭”成议事厅
- Ranveer Singh and Deepika Padukone Step Out for a Dosa Date Amid Dhurandhar 2's Success
- 越来越多的快递,为何能越送越快?,越来越多的快递,为何能越送越快?
- 逾4.5米高倾斗罗里驶入快速公路隧道致天花板坍塌 封锁9小时维修
- 【观点】正信期货:预计短期乙二醇回调整理为主
- 与13岁女生发生性关系!新西兰男子欲逃往中国,在机场被抓
- 非遗共融·中意同辉——南通大学锡耶纳学院“意韵东方”实践团赴意大利开展跨文化交流研学
- 학생 19만명 줄었는데 이주배경학생은 8600명 늘었다…초등생 20명 중 1명
- Cloudflare 称 AI 智能体已占 60% 互联网流量,同比激增 1700%
- 骑士潜在先发出炉!14+3名单均高近2米软肋已消 克城夺冠概率提升1%
- 德罗赞助掘金冲击西部前六 预测概率升至86%
- 霍尔木兹海峡通行商船数量降至3个多月以来新低
- 外交部副部长苗得雨会见伊朗外交部副部长,伊方感谢中方主持公道正义,期待中方为维护地区和平稳定发挥更大作用
- 上海:加快具身智能技术熟化 加强智能机器人自主全产业链布局
- 大连以重点领域攻坚助推营商环境优化_问题_违纪
- Ahan Shetty Shines in Powerful New Poster of Border 2
- 近20年最严重地磁风暴来袭!奥克兰爆现极光……
- 个人博客怎么赚钱?从兴趣到收入的转化路径
- 黄金站上4400,难道是新一轮上涨开始了?|1222 张博划重点
我的网站热门资讯
- 《GTA6》本体泄露是假消息?外媒删稿道歉:未查证
- 《不心动才有鬼》采访花絮 浩浩妈王星辰遭调侃“恶心”
- Why Did Director Sujeeth Receive a Luxury SUV As a Gift From Pawan Kalyan? Revealed!
- More than 90% of people killed by Afghanistan quake were women and children, UN says
- 포항 바이오기업, 스위스 바이오텍 데이 참가 성과 이어져
- Chatha Pacha Title Track Drops As Shankar-Ehsaan-Loy Make a Striking Malayalam Debut
- Nick Jonas Proves Why He Is The Ultimate National Jiju As He Grooves to Dhurandhar's Song
- 法国声称,太平洋地区的叛乱已经被成功镇压!
- 创新引领 临安走好“三型”发展之路
- 今日趣图:曼联保级成功欧联唯一不败球队,留力剑指冠军!
- Canalys: 2022年第三季度全球智能手机出货量下降了9%
- 签了!比尔2年1320万!好家伙,头真铁啊.....
- 韩国警方进入总统官邸内部 越过第一道拦阻线
- 特斯拉最快将于11月底向欧洲客户交付Model S Plaid
- 海牛副总经理冯文静:我不认输,我也不会放弃我的血性
- 僵局持续!哈登、沃特森领衔六大未签约球星,最新去向预测出炉
- 卡塔尔要求2022世界杯游客在手机上安装有争议的软件
- 新加坡未来技能发展:学分可用于顶级在线课程订阅
- 沪滇协作山海情|中共一大纪念馆党委一行赴滇开展党建联建等工作
- 整治非法穿越自然保护区 让绿色出行有权益可兑换 杭州交出十年绿色答卷
- 政声直达·热点快评 | AI客服再聪明,也得给人工留扇门
- 东方嘉盛:上半年归母净利润1.99亿元,同比增长148.95%
- 戴夫·弗兰科与《Idiots》卡司详解这部喜剧中最具爆炸性的场景
- LATAM航班高空惊魂:飞机剧烈晃动,乘客被抛向空中,有人浑身是血
