英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头
英伟达HBM告急!下一代GPU受限,这块硬盘却抢走风头功能型SSD在这条数据链中的合理角色,不是自行判断一段经历是否值得记住,而是在Runtime已经给出对象和策略后,靠近数据执行确定性工作。例如按租户选择密钥,按生命周期放置数据,压缩与去重可缩减的对象,维护索引页与元数据,优先完成即将被推理使用的回载,并把尾延迟、写放大和介质健康反馈给上层。语义决策留在Agent和Runtime,数据执行尽量靠近介质。
搜索
功能型SSD在这条数据链中的合理角色,不是自行判断一段经历是否值得记住,而是在Runtime已经给出对象和策略后,靠近数据执行确定性工作。例如按租户选择密钥,按生命周期放置数据,压缩与去重可缩减的对象,维护索引页与元数据,优先完成即将被推理使用的回载,并把尾延迟、写放大和介质健康反馈给上层。语义决策留在Agent和Runtime,数据执行尽量靠近介质。
LightX2V团队面向Wan2.2-A14B推出LightWan2.2-A14B,以步数蒸馏、NVFP4量化感知训练和动态稀疏注意力压缩计算量,再用高效算子、细粒度卸载和多卡通信优化打通整条推理链路。
长视频理解,正在成为多模态大模型的重要能力。
采访中,吴英成把自己正在做的事压缩成一句话:“上一代 AI 蒸馏的是互联网,下一代 AI for Science 应该‘蒸馏地球’。”
市面上已有几十种Agent记忆方案,有的基于向量检索,有的基于知识图谱,有的靠定期总结“压缩”对话,有的则完全依赖模型自身的上下文窗口。它们各有各的说法,但在系统层面,到底哪种方案靠得住?哪种方案在你的工作负载下既不贵又准?
现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 “提示词压缩”(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。
以前:搜 Google → 开 8 个标签页 → 对比功能 → 约演示 → 买。现在:搜那个默认大牌 → 再搜「某某大牌 的替代品」→ 从冒出来的 3 个名字里挑一个 → 约演示 → 买。整条对比研究,被 AI 一次答复压缩成了「三选一」
如果我们谈到 AI 赋能带来的科学突破,AlphaFold 一定是不可忽略的一项。它解决了困扰生物学界半个多世纪的蛋白质折叠难题,大量压缩了得到蛋白质结构的时间,从原来的一年,到现在的几分钟。它的核心开发者之一 John Jumper 也因这一贡献在 2024 年摘得诺贝尔化学奖。
当初,Anthropic推出extended thinking的时候,把它包装成「让用户看到思考过程」的透明标杆。现在真相是:你看到的只是他们允许你看到的部分。那些被加密、被压缩、被锁在全局密钥里的内容,藏着什么?
今天几乎所有主流视觉语言模型(VLM)—— 无论是 Qwen-VL、InternVL,还是 LLaVA 系列 —— 都遵循着同一套经典架构:先用预训练视觉编码器(如 CLIP、SigLIP)将图像压缩为特征,再通过投影层把这些特征送入大语言模型。