AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入
AI生图大洗牌!流匹配架构颠覆传统,一个模型同时接受文本和图像输入AI生图新突破!一个模型同时接受文本和图像输入。
搜索
AI生图新突破!一个模型同时接受文本和图像输入。
“要是这些历史能在地图上‘动’起来就好了!” 这个念头一直在我脑子里盘旋。我渴望能有一张直观的地图,让我轻松洞悉历史发展的脉络。目前人工智能浪潮奔涌而至,其在文本、图像乃至动画领域的创造力令人瞩目。我便想着,能否借助AI之力,将《枪炮、病菌与钢铁》所描绘的世界,真实地投射到一张交互式的地图之上?
提质不加价,可灵新版视频生成模型正式登场!新版本依然是一石激起千层浪,不到24小时就有超过72万次阅读。我们也带来了新鲜实测!
多模态大模型(MLLM)在静态图像上已经展现出卓越的 OCR 能力,能准确识别和理解图像中的文字内容。MME-VideoOCR 致力于系统评估并推动MLLM在视频OCR中的感知、理解和推理能力。
每天宣扬「AI变革」的外媒Business Insider,终于看到这把屠龙刀落在了自己头上。刚刚,CEO宣布:裁员21%,全面拥抱AI!讽刺吗?那些亲手写下「AI将颠覆媒体」的记者们,正被AI亲手送下了楼。工会怒斥:这是对新闻的背叛,是对人类记者尊严的公然践踏!更可怕的是,今天是他们,明天会不会轮到你?
来和机器狗一起运动不?你的羽毛球搭子来了!无需人工协助,仅靠强化学习,机器狗子就学会了羽毛球哐哐对打。基于强化学习,研究人员开发了机器狗的全身视觉运动控制策略,同步控制腿部(18个自由度)移动,和手臂挥拍动作。
多AI智能体系统的复杂构建与优化,长期以来是用智能体解决科研问题和场景落地的瓶颈。来自英国格拉斯哥大学的研究团队发布了全球首个AI智能体自进化开源框架EvoAgentX,通过引入自我进化机制,打破了传统多智能体系统在构建和优化中的限制!
就是这两个黄毛小伙子,他们试图建立新的教育体系。 他们为学生创建了一种制作自定义视频教程的方法,一键生成所有科目的讲解视频,比真人老师讲的更好更仔细,就像可汗学院一样,并允许他们像与真正的导师/老师交谈一样进行互动,让每位学生都有私教老师。
我在《晚点》公众号读到一篇质量非常高的访谈,嘉宾是 AI 应用创业公司 YouWare 的创始人明超平。YouWare 做的事情正是 Vibe Coding。这篇是我近期读到最为深刻的创始人访谈文章。明超平居然是 95 年的,但认知很深刻,他提到一个有意思的视角:
工程的精度,依旧会是这一波技术浪潮里有意义的竞争力。
4 月 27 日,万兴科技发布 2024 年全年以及 2025 年第一季度财报。
人类在面对简单提问时常常不假思索直接回答,只有遇到复杂难题才会认真推理。
“下一家估值十亿美元的公司,也许只有一个人。”这是 2025 年红杉 AI 峰会(AI Ascent)下午场的开场白。台下本来窃窃私语的投资人一下安静了:如果这句话成真,硅谷几十年建立的“团队规模=护城河”逻辑,将被彻底改写。
Cursor放出了一个接近1小时的内部团队讨论视频,深度分析了他们用到的技术和思考,使得我们有机会深入了解了 Cursor 团队内部关于训练超人级编程模型的讨论,他们的观点让我重新思考了 AI 辅助编程的未来。这些来自一线研究者和工程师的见解,揭示了当前 AI 编程领域最前沿的挑战和突破方向。
上海交通大学联合中科大在本文中指出:现阶段大模型智能体的主要障碍不在于模型能力不足,而在于其「Agentic ROI」尚未达到实用化门槛。研究团队提出 Agentic ROI(Agentic Return on Investment)这一核心指标,用于衡量一个大模型智能体在真实使用场景中所带来的「信息收益」与其「使用成本」之间的比值:
Manus的开放注册标志着其商业化进程的正式启动。但是,Manus到底擅长什么?如果检视Manus的精选用例库,我们会发现约一半的用例是咨询报告(图1),诸如,《B2B供应商寻源报告》、《成衣行业AI产品分析》、《制定门店销售提升策略》等等:
2025年,AMD将推出全新的GPU路线图,瞄准两个竞争激烈的领域:游戏和AI。该公司正在推出一系列重大进展,从简化的产品命名和激进的定价,到尖端的架构和深度AI集成,这表明它决心在多个市场上缩小与英伟达的差距。
上周,有媒体曝出了美团的 AI 零代码工具 NoCode,这是一款无需编程背景和经验,仅通过自然语言和对话形式即可快速生成应用的工具。 顾名思义,NoCode 可帮助很多人以「零代码」的方式创建个人提效工具、产品原型、可交互页面等。它不仅能生成代码,还可以进行实时预览,局部修改并一键部署,大幅降低了开发的门槛,可以帮助更多人释放创意。
昨晚,终于等到了DeepSeek-R1-0528官宣。升级后的模型性能直逼o3和Gemini 2.5 Pro。如今,DeepSeek真正坐实了全球开源王者的称号,并成为了第二大AI实验室。
万元级机器人要来了,下一站可能就是你家楼下商场。
在人类的认知过程中,视觉思维(Visual Thinking)扮演着不可替代的核心角色,这一现象贯穿于各个专业领域和日常生活的方方面面。
在最新的 LangChain Interrupt 峰会上,AI Fund 创始人吴恩达与 LangChain 联合创始人 Harrison Chase 展开了一场对话。
斯坦福Hazy实验室推出新一代低延迟推理引擎「Megakernel」,将Llama-1B模型前向传播完整融合进单一GPU内核,实现推理时间低于1毫秒。在B200上每次推理仅需680微秒,比vLLM快3.5倍。
AI领域的竞争,远未到鸣金收兵的时刻。
3月时候GPT迎来了一波更新,在文生图、图生图领域带来了巨大更新,而紧接而至的却是一些创业公司的哀嚎:
用AI来升级浏览器的使用体验,对于厂商来说稳赚不赔。
“创业没有静态壁垒,只有动态壁垒。”
近日,NVIDIA 联合香港大学、MIT 等机构重磅推出 Fast-dLLM,以无需训练的即插即用加速方案,实现了推理速度的突破!通过创新的技术组合,在不依赖重新训练模型的前提下,该工作为扩散模型的推理加速带来了突破性进展。本文将结合具体技术细节与实验数据,解析其核心优势。
在人工智能技术风起云涌的当下,量化投资行业正迎来新一轮深刻变革。
主席在《矛盾论》中强调"具体问题具体分析,是Marxism的活的灵魂"。而在AI领域,我们终于有了一个能够践行这一哲学思想的技术框架——MAS-ZERO,帮我们构建能够因地制宜、因时制宜的智能系统。