生成模型也能端到端训练了?核心竟是一个for循环
生成模型也能端到端训练了?核心竟是一个for循环最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。作者给这个新范式起了个名字,叫 Explorative Modeling(探索式建模),模型简称 XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴。
搜索
最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。作者给这个新范式起了个名字,叫 Explorative Modeling(探索式建模),模型简称 XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴。
这篇文章,我们邀请到了由SGLang孵化的RadixArk的联合创始人和核心成员,以及数据中心专家,一起聊聊AI Infra的四层架构、行业如何把“硅”的潜力榨到极限,以及背后的关键技术。
上海交通大学联合上海创智学院团队提出 A²-Edit,它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。
今日,华为开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。该模型是openPangu-2.0系列的最新开源模型,总参数规模5050亿,激活参数规模180亿,支持512K上下文长度,训练数据总量约34T tokens。另一轻量化模型openPangu-2.0-Flash已于6月12日开源,参数92亿,其中6亿为激活参数。
ESP-GMF 是一套面向乐鑫 SoC 的统一多媒体开发框架,通过统一的数据流模型、组件体系和开发架构,将音频、视频及 AI 多媒体能力整合到同一平台,为开发者提供更加高效、灵活且易扩展的开发体验。
词元无限的创业赛道很明确,ToB Coding。做 Coding 是因为创始人杨萍之前在字节内部的 Coding 项目经历,一个好的 Coding 产品+内部的数据,就能很好在字节内部落地,真正解决问题。
2026 年 4 月起,一位专营稀有书和低流通量图书的美国书商遇到了怪事:他店里的生意向来不算火爆,一周卖出二十本已经算不错,但最近,订单突然像洪水一样涌来,每周能卖几百本。最费解的是,买家只列出一份用国际标准书号(ISBN)索引的书籍清单,却从不询问品相,也不砍价。
近期,SemiAnalysis 创始人 Dylan Patel 先后做客红杉资本的《Training Data[1]》和 WisdomTree 的《The Next Big Thing[2]》。两期访谈从模型和芯片,一路延伸至内存、能源、数据中心与 AI 商业模式,并指向同一个变化:AI 竞赛的焦点,正从单纯比较模型能力,扩展到谁能以更低成本、更大规模,把模型能力稳定地交付出来。
Encore AI是一家专门研究企业客户互动数据、以此训练和部署AI语音Agent的初创公司,其Agent既可与客服和销售团队协同工作,也可独立自主运行。该公司近日完成由Team8领投的3000万美元A轮融资。
在真实工业环境中,数据并不是静止不变的。