刚刚,GPT-6开真车考过了科目二!
刚刚,GPT-6开真车考过了科目二!硅谷DrivingBench测试中,从未专门学过开车的通用大模型GPT-6 Astra操控改装丰田卡罗拉以5分22秒通过锥桶摆出的科目二考场,成为全场唯一通关的大模型,而Claude Fable 5.1、Grok 4.6和GPT-5.6 Sol均未通过。
搜索
硅谷DrivingBench测试中,从未专门学过开车的通用大模型GPT-6 Astra操控改装丰田卡罗拉以5分22秒通过锥桶摆出的科目二考场,成为全场唯一通关的大模型,而Claude Fable 5.1、Grok 4.6和GPT-5.6 Sol均未通过。
Claude Sonnet 5.5在Claude Code中被抓包偷跑并开启灰度测试,多位开发者实测显示其性能碾压GPT-6 Sol并在编码与Agent能力上直逼GPT-6 Astra,同时定价低至百万Token输入2美元,Anthropic意在OpenAI DevDay前截杀对手。
Agent Space作为汇集顶级Agent的云端工作空间,支持Claude Code、CodeX、OpenCode等本地工具接入云端运行,并可直接使用Opus 5.5、GPT-6 Sol、GPT-6 Luna及GPT-6 Astra等最新模型,其订阅额度还能同步接入本地Agent使用,降低了高价AI模型的使用门槛。
今天,OpenAI 正式发布了 GPT-6 Sol 和 GPT-6 Luna。不过,人们似乎更加关心 OpenAI 何时推出它的个人 AI 智能体 Aeon (Codex Bot)。
价格卷过DeepSeek Flash。
DeepSeek 快醒醒,ChatGPT 要打到家门口了。
OpenAI同日发布GPT-6 Sol与GPT-6 Luna,API价格相比GPT-5.6腰斩50%,主打单位任务成本优势;Anthropic推出Claude Opus 5.5,典型任务成本降低约40%且输出速度提升超30%,两家厂商围绕"性价比"展开直接竞争。
Anthropic发布Claude Opus 5.5,性能追平Fable 5.1且成本降低40%,在Terminal-Bench 4.0和GDPval-AA v2.1等多项基准测试中超越GPT-6 Astra,OpenAI两小时内推出GPT-6 Sol和Luna迎战。
GPT-6 Sol,真要来了!
TypeSafe AI 开发的非大语言模型 Jev 正式向所有用户开放并赠送约 1.2 亿 Token 额度,该模型由前 OpenAI 研究员 Diogo Almeida 创立,可输出类型化结构决策,速度较同类大语言模型快 20 至 200 倍。