AI资讯新闻榜单内容搜索-Mark

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Mark
3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law

7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。EdgeBench 的切口就是把盲区里的东西放进评测,解答一个问题:把Agent扔进一个陌生环境,12小时后,你能变强多少?

来自主题: AI技术研报
9052 点击    2026-07-08 15:53
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

为了解决这一问题,来自 University of Arizona、Zoom 与 Stony Brook University 的研究团队推出了 VISTA(VIsual Spec-To-App Benchmark), 首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。

来自主题: AI技术研报
8374 点击    2026-07-06 15:49
扎克伯格承认:Meta AI智能体研发不及预期

扎克伯格承认:Meta AI智能体研发不及预期

扎克伯格承认:Meta AI智能体研发不及预期

今日,据路透社报道,Meta创始人兼CEO马克·扎克伯格(Mark Zuckerberg)当地时间7月2日在公司内部全员会上承认,过去至少四个月,AI智能体技术的研发进展并未如他预期般提速,Meta押注AI新组织架构的布局“至今尚未落地见效”。路透社称,这一信息来自其听取的一段会议录音。

来自主题: AI资讯
8220 点击    2026-07-03 16:11
AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口「很小」

AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口「很小」

AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口「很小」

OpenAI首席研究官Mark Chen释放了一个强烈信号:OpenAI 并不认为scaling laws已经失效,恰恰相反,预训练、数据工程、推理训练和更长任务链条,仍是通向AGI的主干道路。

来自主题: AI资讯
6086 点击    2026-07-02 10:34
全球算力分布地图曝光:谁掌握能源,谁掌握AI未来

全球算力分布地图曝光:谁掌握能源,谁掌握AI未来

全球算力分布地图曝光:谁掌握能源,谁掌握AI未来

近日,国际能源研究机构AixEnergy发布《Market Outlook》报告,提出一个值得关注的判断:AI基础设施首先是一项能源决策,其次才是一项技术决策。报告认为,决定未来全球AI版图的关键因素,正从芯片、模型和算法,转向稳定、低成本且能够快速接入的能源系统。海湾国家凭借廉价电力迅速崛起,美国受制于电网瓶颈,中国则依托新能源和产业链优势加速布局,东南亚正试图成为新的算力高地。

来自主题: AI技术研报
9794 点击    2026-06-24 17:38
开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了

开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了

开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了

从v0.7开始,我先给 Humanize PPT 划了一条边界。把渲染PPT页面外包给下游的Skill。Humanize PPT负责把大纲,逐页意图,视频和图片素材的坑位和演讲稿,整理成结构化的 JSON 与 Markdown,再交给下游 Skill 原生渲染。

来自主题: AI资讯
9047 点击    2026-06-20 14:12
葬AI基准测试发布:GLM 5.2第一,超越Opus 4.8

葬AI基准测试发布:GLM 5.2第一,超越Opus 4.8

葬AI基准测试发布:GLM 5.2第一,超越Opus 4.8

这是葬AI起号以来工作量最大的一篇文章。为了严肃评测国产模型的能力,我自研了一个Benchmark,完整测试了智谱、Qwen、Kimi、Minimax、Deepseek这些最新国产模型,还引入了境外势力Claude作对照组。

来自主题: AI资讯
9615 点击    2026-06-17 13:30
我做了个测试 Claude API 中转站的 Skill,测完发现水太深了

我做了个测试 Claude API 中转站的 Skill,测完发现水太深了

我做了个测试 Claude API 中转站的 Skill,测完发现水太深了

根据我长期使用的观察,0.3 倍率说是用 Kiro 逆向出来的 Claude,2.0 倍率说是正经 Claude Max 号池接出来的。听起来后者肯定更靠谱。我一开始也这么想的。毕竟倍率差了快七倍,价格摆在那,总不至于拿假货糊弄人吧。

来自主题: AI资讯
15210 点击    2026-06-11 16:53