斯坦福等机构的新论文提出 DuMateBench 基准,用 200 个从真实用户会话重建的任务评测自主智能体,任务混合编码、网页研究、文档工作和内容创作,环境还包含缺失依赖、不稳定网络和干扰文件。
X
关注 AI 研究者、开发者与机构的动态
按账号或来源筛选(540)
@rohanpaul_ai@rohanpaul_aiAI 评分5252 
@rohanpaul_ai@rohanpaul_aiAI 评分6262 

@elonmusk@elonmuskAI 评分77 @elonmusk@elonmuskAI 评分55 @elonmusk@elonmuskAI 评分55 @elonmusk@elonmuskAI 评分55 @elonmusk@elonmuskAI 评分55 @AYi_AInotes@AYi_AInotesAI 评分4545 
@AYi_AInotes@AYi_AInotes精选AI 评分6565
引用@OfficialLoganK@OfficialLoganKIntroducing Gemini 3.8 Flash, another jump in Gemini's agentic + coding capabilities, and our 3rd updated Flash model in only 6 weeks... This model has been a ton of fun to work with, excited to see what you all think! https://t.co/Cj07lCBtp8
推荐理由:文中列出 Gemini 3.8 Flash 与 Opus 5 的多项基准和价格对比,读者可据此看到廉价模型与旗舰模型当下的分工边界。
@WorkBuddy_AI@WorkBuddy_AIAI 评分1212 @WorkBuddy_AI@WorkBuddy_AIAI 评分1111 @WorkBuddy_AI@WorkBuddy_AIAI 评分3333 
@dexhorthy@dexhorthyAI 评分2222 
@gabriel1@gabriel1AI 评分1414 openai cerebras 将改变我们的工作方式,或者至少某个极快的模型会 与智能体并行工作太痛苦了,当人们尝到高质量同步工作的滋味后,会愿意付很多钱 然后我们将通过文本界面完成与计算机的所有交互
@AravSrinivas@AravSrinivasAI 评分2222 @emollick@emollickAI 评分88 我问它为什么 catalog 用了英式拼写。https://t.co/VtEeAGeVWk

@gabriel1@gabriel1AI 评分1010 对于在日常运营工作中两者都用过的人: - grokbot - cowork 或 chatgpt work 在处理所有日常实际工作时,你更偏好哪个界面?请不要考虑个人使用场景
@emollick@emollickAI 评分2828 
@openclaw@openclawAI 评分4545 @ArtificialAnlys@ArtificialAnlysAI 评分5353 @ArtificialAnlys@ArtificialAnlysAI 评分4141 视频编辑(含音频)提示词:将猫的鱼眼 POV 重新风格化为手绘卡通风格,同时保留第一人称运动。https://t.co/fcpOxQzCWl

@ArtificialAnlys@ArtificialAnlysAI 评分3030 文生视频(带音频)提示词:一只猫盯着烤面包机里自己的倒影,爪子拍打镀铬表面。扭曲的猫倒影也拍回来。音频:爪子拍打声、困惑的喵叫。https://t.co/Ji3BjeIpgt

@ArtificialAnlys@ArtificialAnlysAI 评分3434 图生视频(带音频)提示词:龙展开双翼,腾空而起,以有力的振翅飞越天空。尾巴拖在身后,翱翔向远方。沉重的翅膀拍打声、低沉的咆哮和呼啸的风声。https://t.co/fvk1pE5AbZ

@ArtificialAnlys@ArtificialAnlys精选AI 评分7070 阿里巴巴发布一体化视频生成与编辑模型 Wan 3.0,可生成最长 30 秒 1080p 带原生音频的视频,并接受文本、图像、视频、音频、文档和网页作为创作参考。

推荐理由:第三方竞技场盲测排名给出 Wan 3.0 与同类视频模型的直接对比,并列出各分辨率定价。
@dexhorthy@dexhorthyAI 评分1010 在所有前沿模型上跑完整的 slopcode bench 要花不少时间,但我们快搞定了 https://t.co/8wX2nBdaQ4

@rohanpaul_ai@rohanpaul_aiAI 评分2929 他们真的从演示走到了车间 深圳的工人正在手工组装 HuggingFace/Pollen Robots https://t.co/uXHhnvhu5u

@gabriel1@gabriel1AI 评分2020 @alibaba_cloud@alibaba_cloudAI 评分2323 
@fchollet@fcholletAI 评分1717 @emollick@emollickAI 评分1414 我觉得人们应该试试,因为直接和电脑对话真的很惊艳,但当你开始用它做真正的工作时,事情很快就变得复杂了:它正在处理的内容在哪里?我如何给“语音”提供信息?我如何恢复一段对话?
@jxnlco@jxnlcoAI 评分6464 网站可以通过 webmcp 直接向 ChatGPT 和 Codex 提供工具。在支持的账号上,于桌面应用内置浏览器打开受支持的网站,地址栏箭头会显示该网站的工具,无需单独建立连接。
@emollick@emollickAI 评分2525 @HuaweiCloud1@HuaweiCloud1AI 评分2727 



@rohanpaul_ai@rohanpaul_aiAI 评分5757 UC Berkeley 论文 Daydreaming 提出一种仅通过黑盒任务交互窃取隐藏智能体技能的攻击,在 7 个技能和 4 个模型上复现了原始技能 86.8% 的能力。

@rohanpaul_ai@rohanpaul_aiAI 评分55 @alibaba_cloud@alibaba_cloudAI 评分2525 
@AYi_AInotes@AYi_AInotesAI 评分3636 
@AYi_AInotes@AYi_AInotesAI 评分3535 
@PixVerse_@PixVerse_AI 评分1212 在完整的 PixVerse Canvas 项目中查看参考、提示词和最终视频: https://t.co/wUhJ9bJJF7
@PixVerse_@PixVerse_AI 评分2828 