AI资讯新闻榜单内容搜索-大模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 大模型训练
五年前的一次选择,成了中国智能时代的王炸

五年前的一次选择,成了中国智能时代的王炸

五年前的一次选择,成了中国智能时代的王炸

五年前中科曙光立项曙光8000时提前押注"超智融合"路线,建成中国首个全国产十万卡AI超集群,将高精度科学计算与AI大模型训练集成于同一系统,近日随央视纪录片《超级工程》完整呈现其五年技术攻关与落地的全过程。

来自主题: AI资讯
7630 点击    2026-09-28 09:52
打破“算力存储通信”三堵墙,昇腾超节点给出十万亿大模型训推“最优解”

打破“算力存储通信”三堵墙,昇腾超节点给出十万亿大模型训推“最优解”

打破“算力存储通信”三堵墙,昇腾超节点给出十万亿大模型训推“最优解”

华为昇腾950超节点在华为全联接大会2026正式上市,作为业界最大规模商用超节点,通过灵衢互联、统一内存编址等技术创新打破算力、存储、通信瓶颈,为十万亿级大模型训练与推理提供最优解。

来自主题: AI资讯
9259 点击    2026-09-25 10:11
DeepSeek新论文公开Agent训练!梁文锋署名

DeepSeek新论文公开Agent训练!梁文锋署名

DeepSeek新论文公开Agent训练!梁文锋署名

大模型训练拼的是算力,Agent训练拼的是环境。

来自主题: AI技术研报
9106 点击    2026-09-23 18:04
多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。

来自主题: AI技术研报
8840 点击    2026-07-24 15:55
美团 LongCat-2.0:第一个在纯国产芯片训练的万亿参数大模型

美团 LongCat-2.0:第一个在纯国产芯片训练的万亿参数大模型

美团 LongCat-2.0:第一个在纯国产芯片训练的万亿参数大模型

如果只看标题,它很容易被归到“又一个万亿参数大模型”的队伍里:1.6 万亿总参数、MoE 架构、100 万 token 上下文、面向代码和 Agent 场景。但这次真正值得看的,不只是模型有多大,而是它背后的三个问题:国产算力能不能支撑前沿级大模型训练?

来自主题: AI资讯
10876 点击    2026-06-30 21:04
马斯克也拥抱C语言了!大模型训练堆栈抛弃JAX,提速一个数量级

马斯克也拥抱C语言了!大模型训练堆栈抛弃JAX,提速一个数量级

马斯克也拥抱C语言了!大模型训练堆栈抛弃JAX,提速一个数量级

不用JAX,SpaceX正在用C语言编写的全新堆栈训练新模型。而且马斯克本人亲口承认,Grok 5已经用的就是这个新堆栈。按马斯克的说法,这种新堆栈能让大模型训练速度提升一个数量级。

来自主题: AI资讯
8540 点击    2026-05-29 15:10
15个前沿大模型,100个职业场景:谁才是最强AI打工人?

15个前沿大模型,100个职业场景:谁才是最强AI打工人?

15个前沿大模型,100个职业场景:谁才是最强AI打工人?

当大模型训练进入深水区,竞争的关键已经不再只是「模型参数怎么调」,而逐渐转向一个更核心、也更难系统解决的问题:模型在训练过程中究竟看到了什么数据、以什么比例看到、哪些样本应该被更频繁地学习。

来自主题: AI资讯
9332 点击    2026-04-16 11:16
北大联合Llama-Factory推出DataFlex:工业级数据动态训练系统

北大联合Llama-Factory推出DataFlex:工业级数据动态训练系统

北大联合Llama-Factory推出DataFlex:工业级数据动态训练系统

当大模型训练进入深水区,竞争的关键已经不再只是「模型参数怎么调」,而逐渐转向一个更核心、也更难系统解决的问题:模型在训练过程中究竟看到了什么数据、以什么比例看到、哪些样本应该被更频繁地学习。

来自主题: AI技术研报
7676 点击    2026-04-16 11:16