当前位置:首页 > DeepSeek技术交流 > 正文内容

DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?

6个月前 (02-26)DeepSeek技术交流425

一开始,我还以为 DeepSeek 会走传统路线,比如大厂常见的蒸馏技术,搞个小参数的 Flash 模型。毕竟这种方法能有效降低计算需求,但缺点也很明显,就是小模型再怎么优化,和大模型比起来,性能还是会有损失 结果 DeepSeek 完全没按套路出牌,它不是去压缩模型,而是换了个角度,直接假设未来算力足够,然后想办法更高效地用好现有显卡架构。换句话说,不是缩小参数规模,而是在同等规模下优化计算方式,让计算更具性价比 这种思路比纯工程优化要“硬核”得多。一般来说,搞小模型是比较务实的工程方案,但 DeepGEMM 这种技术驱动的做法更有延展性。它不仅和小模型方法兼容,而且即使以后显卡更强、模型规模更大,这套技术依然能继续用,不会过时

“DeepSeek 又上新!DeepGEMM 发布,有哪些突破点值得一看?” 的相关文章

DeepSeek能干什么?搜论文、学代码……多所高校接入的DeepSeek“满血版”有哪些神奇之处?

DeepSeek能干什么?搜论文、学代码……多所高校接入的DeepSeek“满血版”有哪些神奇之处?

新学期,多所高校掀起了智能化革新浪潮。中国人民大学、华东师范大学、北京邮电大学等高校正式接入了DeepSeek“满血版”。这个拥有6710亿参数的“超级大脑”,正在以每周迭代的领域知识和强大的“思维链...

无人机+DeepSeek 郑州交警解锁城市交通治理新模式

无人机+DeepSeek 郑州交警解锁城市交通治理新模式

□大河报·豫视频记者 邵可强 文图当警用无人机遇上人工智能会擦出怎样的火花?在郑州街头,一场由“无人机+DeepSeek”引领的交通管理变革正在悄然上演。4月14日,大河报记者了解到,从空中侦察员、安...

朱民:未来18个月 中国将出现超百项“DeepSeek式突破”

朱民:未来18个月 中国将出现超百项“DeepSeek式突破”

【朱民:未来18个月 中国将出现超百项“DeepSeek式突破”】财联社6月26日电,IMF原副总裁朱民在2025年夏季达沃斯论坛期间表示,得益于庞大的工程师队伍、产业规模和消费市场,在未来18个月内...

掌趣科技:认为deepseek能助力游戏开发实现行业创新

掌趣科技:认为deepseek能助力游戏开发实现行业创新

金融界3月27日消息,有投资者在互动平台向掌趣科技提问:请问deepseek是否能助力游戏开发,从而实现行业创新,降本增效?公司回答表示:我们认为答案是肯定的。本文源自:金融界...

“联通元景+DeepSeek” 赋能重庆12345热线智慧升级

“联通元景+DeepSeek” 赋能重庆12345热线智慧升级

在人工智能技术快速发展的背景下,中国联通积极推进数字化建设,助力重庆12345政务服务便民热线接入DeepSeek R1国产大模型,并融合中国联通元景大模型技术,实现民生诉求场景下热点问题的全维度态势...

北京企业登记首次接入DeepSeek

北京企业登记首次接入DeepSeek

“您好,我想注册一家公司,需要什么材料?”登录北京市企业服务e窗通平台输入需求后,智能问答助手“市监小e”即刻开始了工作:“好的,请您先确认拟设立的主体类型……”经过简短沟通,小e迅速理解了办事人的需...