大模型「行口」不一?首个专测执行幻觉基准,覆盖真实行为越狱
大模型「行口」不一?首个专测执行幻觉基准,覆盖真实行为越狱随着大模型智能体深入渗透真实操作系统,一种全新的安全威胁悄然成型:行为越狱(Behavior Jailbreak)。现有安全基准只盯着模型「说了什么」,却对「做了什么」视而不见。新基准LITMUS是首个同时覆盖真实OS环境行为越狱、语义-物理双层验证与多攻击范式的完整评测体系,并首次系统量化了「执行幻觉」这一被整个评测社区忽视的致命盲区。
搜索
随着大模型智能体深入渗透真实操作系统,一种全新的安全威胁悄然成型:行为越狱(Behavior Jailbreak)。现有安全基准只盯着模型「说了什么」,却对「做了什么」视而不见。新基准LITMUS是首个同时覆盖真实OS环境行为越狱、语义-物理双层验证与多攻击范式的完整评测体系,并首次系统量化了「执行幻觉」这一被整个评测社区忽视的致命盲区。
距离今年的苹果全球开发者大会 WWDC 还有几天, 关于苹果新系统的爆料也已经越来越完整,外界几乎快提前「拼」出了今年的软件版图。
今年,我们正在打开 AI 自我进化的大门,按下了通往 AGI 的加速键。
把一件皱成一团的衣服叠好,是家务,也是机器人操作里的“硬仗”。
2026 年初,各大 AI 厂商在上下文窗口长度上展开激烈角逐。Google 的 Gemini 3 Pro 已支持 100 万级 token 上下文,Meta 的 Llama 4 Scout 更宣称可处理 1000 万 token。GPT-5 系列也在快速推进长上下文能力。
AI模型在电脑上预测精度爆表,一到实验室就各种出错用不了?
核心观点:由前Apple Vision Pro两位技术负责人联合创办的Reactor,近期完成5900万美元种子轮及A轮融资,由Lightspeed Venture Partners领投,WndrCo
MiniMax M3 今日正式发布。MiniMax M3 在编程和智能体等专业任务上达到了前沿的能力。它使用了我们提出的全新注意力架构 MSA (MiniMax Sparse Attention),最高支持 1M 超长上下文。如外界所期待的那样,它也是一个原生多模态模型,支持图片和视频的输入,并能操作电脑桌面。
今天,扣子 3.0 正式上线,扣子手机端 (iOS / Android)、电脑端(Mac OS / Windows)、网页端(coze.cn)三端全量更新。这一次,扣子带来了全新电脑端,扣子 App 也全面升级,我们把 Agent 带进了更完整的工作现场:
刚刚,The Information 曝光了 Meta 内部备忘录、说明年春天要推出一款 AI 吊坠,我的第一反应大概是,又来?但我发现,不只是 Meta,在之前苹果和 OpenAI 曝光的AI 硬件计划,你会发现那个两年前被判死刑的脖挂形态,正被行业巨头再次捡回来。