从机器鸭乐高、宜家说明书到《塞尔达》,Opus 5.5正在重新定义vibe coding
从机器鸭乐高、宜家说明书到《塞尔达》,Opus 5.5正在重新定义vibe codingOpus 5.5因网友用其设计含1113个真实零件的Microduck乐高版本并生成141页说明书、将宜家说明书转为3D配音教学视频以及尝试重现《塞尔达传说:时之笛》等"vibe coding"新玩法持续走红,并在Code Arena: WebDev榜单以低于第二名60%的价格拿下第一。
搜索
Opus 5.5因网友用其设计含1113个真实零件的Microduck乐高版本并生成141页说明书、将宜家说明书转为3D配音教学视频以及尝试重现《塞尔达传说:时之笛》等"vibe coding"新玩法持续走红,并在Code Arena: WebDev榜单以低于第二名60%的价格拿下第一。
Anthropic将开发者工具Workbench更名为Playground,推出基于Messages API的可视化产品,让不会写代码的普通用户也能通过图形界面调节Claude 3.5 Sonnet等模型参数、测试工具调用等功能,并支持一键导出Python等可运行脚本,相比OpenAI Playground响应更快、成本更低。
埃默里大学提出的Decompose–Look–Reason(DLR)框架被EMNLP 2026接收,该方法通过分解问题、按premise提取视觉latent再推理,在Qwen3-VL-8B-Thinking上于V*、MathVista等基准取得显著提升。
机器学习期刊TMLR联合主编Nihar B. Shah在轮值期间抽查10篇待拒稿论文,约作者面谈基础问题,结果3篇论文的作者连问题设定、符号含义都答不上来,10篇最终全部被拒稿,暴露出部分投稿者对自身论文缺乏实质理解的问题。
上海交通大学卢策吾、汶川团队联合穹彻提出LIFT(Late Reactive Injection of Force for VLA Post-Training),被CoRL 2026高分收录,该方法在保留预训练知识的前提下,仅通过20至30条在线带力数据后训练即可让VLA学会力反馈,显著提升叠毛巾、插书、汉诺塔圆环放置等接触密集型任务表现。
中国科学院大学研究团队在《数据科学年鉴》发表论文《智能体能力周期表:从零智能到无限智能的243种构型》,将智能体抽象为控制、生成、记忆、输入、输出五种能力并各分三级,构建243种构型的分类表,指出人类与细菌同处122号格子、最强大模型智能体仅在控制维度比人类低一位即落在41号,并据此对经典力学、相对论与量子力学三大物理理论的观察者差异提出新解读。
作者整理了GPT-Image 2.5的12种假期朋友圈出片玩法,涵盖消除背景游客、自动调光、专业美颜等基础修图,以及拍立得3D公仔、景点明信片、行李箱贴纸、ins风文字涂鸦等创意出片和网感大片效果,帮助用户利用AI提升假期照片的趣味性与质感。
新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。
南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。
谷歌DeepMind掌门人首次确认Gemini 4 Pro已进入后训练早期阶段,开发者在实测中发现其新检查点在3D物理模拟、代码生成等任务上表现碾压Opus 5.5,且泄露参数显示其具备1000万Token上下文窗口和极具攻击性的定价,谷歌力争在年底前正式发布。