跳到正文

X

关注 AI 研究者、开发者与机构的动态

当前显示全部 AI 相关新闻
按账号或来源筛选(536)
全部X新闻X:Rohan Paul1546 条X:Kim1265 条X:阿易 AI Notes968 条X:阿里云 / Alibaba Cloud491 条X:Testing Catalog431 条X:cb_doge404 条X:Elvis Saravia386 条X:Elon Musk356 条X:OpenRouter332 条X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官)330 条X:Ethan Mollick317 条X:Artificial Analysis301 条X:PixVerse295 条X:ZHO257 条X:SemiAnalysis249 条X:Replit232 条X:OpenAI Developers219 条X:小北193 条X:Dex Horthy(HumanLayer)162 条X:swyx162 条X:MiniMax158 条X:Gemini157 条X:Emad Mostaque144 条X:Tibo131 条X:AI Safety Memes130 条X:Epoch AI126 条X:OpenAI125 条X:X.PIN120 条X:Thomas Wolf(Hugging Face 联创/CSO)106 条X:Runway104 条X:Google AI for Developers103 条X:蚂蚁百灵101 条X:面壁智能 OpenBMB97 条X:马东锡 NLP94 条X:Aravind Srinivas(Perplexity CEO)92 条X:Luma AI92 条X:Claude Devs91 条X:洪明89 条X:Jason Liu88 条X:Nathan Lambert87 条X:Frank Wang 玉伯86 条X:fofr83 条X:Sam Altman81 条X:赵纯想80 条X:Gabriel79 条X:Yuchen Jin78 条X:Perplexity72 条X:阑夕71 条X:Eric Zakariasson71 条X:Cohere69 条X:Francois Chollet68 条X:Claude64 条X:Peter Steinberger64 条X:Tencent WorkBuddy64 条X:opencode63 条X:Greg Brockman61 条X:Krea AI60 条X:Microsoft Research55 条X:通义千问 / Qwen53 条X:karminski53 条X:Clément Delangue(Hugging Face CEO)52 条X:Suno52 条X:腾讯混元51 条X:Anthropic50 条X:OpenClaw49 条X:Thariq48 条X:Google DeepMind45 条X:商汤 SenseTime (@SenseTime_AI)42 条X:AK41 条X:Charlie Holtz41 条X:Deedy Das38 条X:Google AI38 条X:Boris Cherny36 条X:可灵 Kling AI32 条X:Peter McCrory(Anthropic 首席经济学家)31 条X:百度 Baidu30 条X:AI at Meta28 条X:Aidan Gomez(Cohere CEO)27 条X:Josh Woodward26 条X:Logan Kilpatrick26 条X:Mustafa Suleyman(Microsoft AI CEO)26 条X:Viggle AI26 条X:Noam Brown22 条X:李继刚20 条X:Andrew Milich20 条X:Odyssey20 条X:SpaceXAI20 条X:硅基流动 SiliconFlow18 条X:华为云18 条X:Tianyi Cui17 条X:DeepSeek16 条X:Sundar Pichai14 条X:fal (@fal)13 条X:Mistral AI13 条X:PixVerse (@PixVerse)13 条X:智谱 Z.ai12 条X:ARC Prize (@arcprize)12 条X:Demis Hassabis12 条X:Mark Zuckerberg12 条X:Arena (@arena)11 条X:Philipp Schmid(Google DeepMind 开发者体验) (@_philschmid)11 条X:唐杰10 条X:Ammaar Reshi10 条X:Andrew Ng(DeepLearning.AI 创始人)10 条X:Arthur Mensch(Mistral CEO) (@arthurmensch)10 条X:Barret 李靖10 条X:DAIR.AI (@dair_ai)10 条X:ElevenLabs (@elevenlabs)10 条X:Eric Mitchell10 条X:Karina Nguyen10 条X:Lee Robinson10 条X:Noah Zweben10 条X:卡兹克 (@Khazix0918)9 条X:Fei-Fei Li9 条X:Georgi Gerganov(llama.cpp) (@ggerganov)9 条X:Jensen Huang9 条X:Kimi.ai9 条Tripo(官方 X)8 条X:Cognition (@cognition)8 条X:Cursor (@cursor_ai)8 条X:Figure AI (@Figure_robot)8 条X:Gemini Notebook (@Gemini_Notebook)8 条X:Hao AI Lab8 条X:Higgsfield AI (@higgsfield)8 条X:Jeff Dean8 条X:Manus (@ManusAI)8 条X:Meshy (@MeshyAI)8 条X:MiniMax Design (H3) (@Hailuo_AI)8 条X:谢赛宁7 条X:Jim Fan7 条X:Michael Truell7 条X:張小珺 Xiaojùn6 条X:Lisa Su(AMD CEO) (@LisaSu)6 条X:NotebookLM0 条@berryxia · 历史来源430 条@vista8 · 历史来源262 条@op7418 · 历史来源231 条@google · 历史来源30 条@getsuperintel · 历史来源9 条@latentspacepod · 历史来源9 条@android · 历史来源8 条@dreamlabla · 历史来源8 条@mannybernabe · 历史来源8 条@karpathy · 历史来源7 条@alexatallah · 历史来源6 条@ryanleeminimax · 历史来源5 条@theo · 历史来源5 条@aidotengineer · 历史来源4 条@dkundel · 历史来源4 条@reach_vb · 历史来源4 条@dotey · 历史来源3 条@eliebakouch · 历史来源3 条@googlechrome · 历史来源3 条@kilocode · 历史来源3 条@maxforai · 历史来源3 条@newsfromgoogle · 历史来源3 条@richardssutton · 历史来源3 条@skylermiao7 · 历史来源3 条@victorsuortiz · 历史来源3 条@ajambrosino · 历史来源2 条@akashi203 · 历史来源2 条@anatolikopadze · 历史来源2 条@andrewcurran_ · 历史来源2 条@antirez · 历史来源2 条@barrnanas · 历史来源2 条@coreyching · 历史来源2 条@deanwball · 历史来源2 条@designarena · 历史来源2 条@fellmentke · 历史来源2 条@gergelyorosz · 历史来源2 条@gmi_cloud · 历史来源2 条@gravicle · 历史来源2 条@hxiao · 历史来源2 条@id_aa_carmack · 历史来源2 条@jackminong · 历史来源2 条@lennysan · 历史来源2 条@mada299 · 历史来源2 条@microsoft · 历史来源2 条@mikastars39 · 历史来源2 条@mitchellh · 历史来源2 条@nabeelqu · 历史来源2 条@rudrank · 历史来源2 条@sebastienbubeck · 历史来源2 条@zan2434 · 历史来源2 条@___harald___ · 历史来源1 条@_boraturan · 历史来源1 条@0xjaniak · 历史来源1 条@0xkato · 历史来源1 条@47fucb4r8c69323 · 历史来源1 条@559hkdt · 历史来源1 条@aaliya_va · 历史来源1 条@abhikatte42 · 历史来源1 条@abhishekpatiil · 历史来源1 条@aboutberlin · 历史来源1 条@addyosmani · 历史来源1 条@agi2asi · 历史来源1 条@aiaicreate · 历史来源1 条@aimlapi · 历史来源1 条@aisaonehq · 历史来源1 条@aisystemprompt · 历史来源1 条@alemtuzlak · 历史来源1 条@alexxubyte · 历史来源1 条@alupsasca · 历史来源1 条@amasad · 历史来源1 条@ampcode · 历史来源1 条@anas_build_ · 历史来源1 条@aniketmaurya · 历史来源1 条@anitakirkovska · 历史来源1 条@anneliesgamble · 历史来源1 条@antigravity · 历史来源1 条@arafatkatze · 历史来源1 条@argofowl · 历史来源1 条@ashiknewazaj · 历史来源1 条@atabarrok · 历史来源1 条@atomic_chat_hq · 历史来源1 条@awe_automation · 历史来源1 条@awesomekling · 历史来源1 条@awscloud · 历史来源1 条@ayushagarwal · 历史来源1 条@baaadas · 历史来源1 条@bai_agi · 历史来源1 条@bbuddha_xyz · 历史来源1 条@bclavie · 历史来源1 条@beccalytics · 历史来源1 条@benfleming__ · 历史来源1 条@benhylak · 历史来源1 条@benjamineyliu · 历史来源1 条@bfl_ml · 历史来源1 条@bleysg · 历史来源1 条@bolna_dev · 历史来源1 条@bosmeny · 历史来源1 条@boxmining · 历史来源1 条@bozhou_ai · 历史来源1 条@brexhq · 历史来源1 条@brian_armstrong · 历史来源1 条@brianchew · 历史来源1 条@bridgemindai · 历史来源1 条@budgetpixel · 历史来源1 条@cahidarda · 历史来源1 条@calmpromptshq · 历史来源1 条@ce_zhang · 历史来源1 条@cedric_chee · 历史来源1 条@chaitralikakde · 历史来源1 条@chatgpt · 历史来源1 条@chatgptapp · 历史来源1 条@christinetyip · 历史来源1 条@christofsalis · 历史来源1 条@clark__labs · 历史来源1 条@cloudflaredev · 历史来源1 条@cnorth_13 · 历史来源1 条@cnzoecomeback · 历史来源1 条@cocohearts · 历史来源1 条@code_star · 历史来源1 条@codebyaurelia · 历史来源1 条@cohavygal · 历史来源1 条@commandcodeai · 历史来源1 条@consensusnlp · 历史来源1 条@contralabs_ai · 历史来源1 条@cozyblaze265065 · 历史来源1 条@crimedecoder · 历史来源1 条@crtr0 · 历史来源1 条@damnventures · 历史来源1 条@daniellockyer · 历史来源1 条@darioamodei · 历史来源1 条@davidmaliglowka · 历史来源1 条@davidondrej1 · 历史来源1 条@davidsacks · 历史来源1 条@dbirker78883 · 历史来源1 条@deryatr_ · 历史来源1 条@devfun · 历史来源1 条@diegocabezas01 · 历史来源1 条@digitalocean · 历史来源1 条@dimillian · 历史来源1 条@dimitrispapail · 历史来源1 条@discussingfilm · 历史来源1 条@dkthomp · 历史来源1 条@dmitryrybin1 · 历史来源1 条@dmsobol · 历史来源1 条@douglasyaody · 历史来源1 条@duckduckgo · 历史来源1 条@easyrouterio · 历史来源1 条@edgardobriban · 历史来源1 条@eisokant · 历史来源1 条@elliotarledge · 历史来源1 条@encrypted · 历史来源1 条@endpointarena · 历史来源1 条@envato · 历史来源1 条@escanorreloaded · 历史来源1 条@esrtweet · 历史来源1 条@ethanhe_42 · 历史来源1 条@eu_commission · 历史来源1 条@fba · 历史来源1 条@fdavidsont · 历史来源1 条@figmaweave · 历史来源1 条@finn_meeks · 历史来源1 条@first_tree_ai · 历史来源1 条@flavioad · 历史来源1 条@flowith · 历史来源1 条@fminzhou · 历史来源1 条@freddie_spirit · 历史来源1 条@frydwia · 历史来源1 条@futurestacked · 历史来源1 条@garrettlord · 历史来源1 条@garrytan · 历史来源1 条@gavinsbaker · 历史来源1 条@GayaniFigma · 历史来源1 条@genspark_ai · 历史来源1 条@gitlawb · 历史来源1 条@gneubig · 历史来源1 条@gokulr · 历史来源1 条@goodfireai · 历史来源1 条@goodnesmbakara · 历史来源1 条@googleaistudio · 历史来源1 条@gordic_aleksa · 历史来源1 条@gro_tsen · 历史来源1 条@hangsiin · 历史来源1 条@happycapyai · 历史来源1 条@haydenbleasel · 历史来源1 条@helloiamleonie · 历史来源1 条@hey_asiif · 历史来源1 条@hilbertspaess · 历史来源1 条@howtoprompt__ · 历史来源1 条@hq4ai · 历史来源1 条@hypersoren · 历史来源1 条@ianbremmer · 历史来源1 条@interaction · 历史来源1 条@intology · 历史来源1 条@iron_redux · 历史来源1 条@ithilgore · 历史来源1 条@itsreallyvivek · 历史来源1 条@jamesjyu · 历史来源1 条@jameszmsun · 历史来源1 条@jason_young1231 · 历史来源1 条@jawad_rahman_ · 历史来源1 条@jaydendavisnc · 历史来源1 条@jeffbarg · 历史来源1 条@jenzhuscott · 历史来源1 条@jiayuan_jy · 历史来源1 条@jilles · 历史来源1 条@jimcramer · 历史来源1 条@jimsyoung_ · 历史来源1 条@jinjingliang · 历史来源1 条@jjacky · 历史来源1 条@jjackyliang · 历史来源1 条@joefioti · 历史来源1 条@joi___ai · 历史来源1 条@joinhandshake · 历史来源1 条@joinpursuit · 历史来源1 条@joulee · 历史来源1 条@jsconfasia · 历史来源1 条@jsrailton · 历史来源1 条@juminoz · 历史来源1 条@kaizero_ainta · 历史来源1 条@karanganesan · 历史来源1 条@kdaigle · 历史来源1 条@kentherogers · 历史来源1 条@kevinsays · 历史来源1 条@khudonogov · 历史来源1 条@koraykv · 历史来源1 条@kotekjedi_ml · 历史来源1 条@kuberwastaken · 历史来源1 条@kurz_gesagt · 历史来源1 条@kwindla · 历史来源1 条@lafalcemateo · 历史来源1 条@lakshyaaagrawal · 历史来源1 条@larrylv · 历史来源1 条@layoffai · 历史来源1 条@levinstanley · 历史来源1 条@lifeofjer · 历史来源1 条@livekit · 历史来源1 条@lostinlatencyx · 历史来源1 条@lotte_verheyden · 历史来源1 条@lqiao · 历史来源1 条@luciushq · 历史来源1 条@luckeyfaraday · 历史来源1 条@lukaspet · 历史来源1 条@madhavsinghal_ · 历史来源1 条@manassharmahere · 历史来源1 条@markiewagner · 历史来源1 条@marksaroufim · 历史来源1 条@marsxiang_ · 历史来源1 条@maseehg_ · 历史来源1 条@mattshumer_ · 历史来源1 条@mem0ai · 历史来源1 条@mengto · 历史来源1 条@merettm · 历史来源1 条@micahcarroll · 历史来源1 条@michael_chomsky · 历史来源1 条@michaelarnaldi · 历史来源1 条@microsoftai · 历史来源1 条@mike_acton · 历史来源1 条@mikeyyyzhao · 历史来源1 条@minchoi · 历史来源1 条@minimaxagent · 历史来源1 条@minu_who · 历史来源1 条@mkbhd · 历史来源1 条@modal · 历史来源1 条@moritzthuening · 历史来源1 条@moxie · 历史来源1 条@mstockton · 历史来源1 条@mtslive · 历史来源1 条@multimodalart · 历史来源1 条@neelnanda5 · 历史来源1 条@neilrahilly · 历史来源1 条@nickbaumann_ · 历史来源1 条@nirantk · 历史来源1 条@noemititarenco · 历史来源1 条@notjazii · 历史来源1 条@nousresearch · 历史来源1 条@oblomovius · 历史来源1 条@ollama · 历史来源1 条@onlyterp · 历史来源1 条@onlyzhynx · 历史来源1 条@organicgpt · 历史来源1 条@orgrem · 历史来源1 条@p0 · 历史来源1 条@palantirtech · 历史来源1 条@palmerluckey · 历史来源1 条@pandatalk8 · 历史来源1 条@parishilton · 历史来源1 条@patrickcarlyle · 历史来源1 条@patricktoulme · 历史来源1 条@paulg · 历史来源1 条@paulsolt · 历史来源1 条@pbdtokenrouter · 历史来源1 条@pererabinoy · 历史来源1 条@philhchen · 历史来源1 条@pirroh · 历史来源1 条@pjaccetturo · 历史来源1 条@postlive · 历史来源1 条@pranaveight · 历史来源1 条@prathamdby · 历史来源1 条@prince_canuma · 历史来源1 条@pumpkherm · 历史来源1 条@pvncher · 历史来源1 条@qiaoqiao2001 · 历史来源1 条@rajveerbach · 历史来源1 条@randyhaddad6 · 历史来源1 条@rauchg · 历史来源1 条@raveeshbhalla · 历史来源1 条@rayanpal_ · 历史来源1 条@rayfernando1337 · 历史来源1 条@redpoint · 历史来源1 条@ric_rtp · 历史来源1 条@richardsocher · 历史来源1 条@rileybrown · 历史来源1 条@robertvaradan · 历史来源1 条@ronshepherd · 历史来源1 条@rosmine · 历史来源1 条@rthiago · 历史来源1 条@ruben_kostard · 历史来源1 条@runware · 历史来源1 条@rvivek · 历史来源1 条@ryanjunejo · 历史来源1 条@safaricheung · 历史来源1 条@samuelstroschei · 历史来源1 条@sanmking · 历史来源1 条@saranormous · 历史来源1 条@savinovnikolay · 历史来源1 条@scale_ai · 历史来源1 条@scaling01 · 历史来源1 条@sdaily_ai · 历史来源1 条@secscottbessent · 历史来源1 条@seltaa_ · 历史来源1 条@sergiopaniego · 历史来源1 条@servasyy_ai · 历史来源1 条@sethltx · 历史来源1 条@shashankgoyal95 · 历史来源1 条@sherryyanjiang · 历史来源1 条@sherylhsu02 · 历史来源1 条@shl · 历史来源1 条@sighjith · 历史来源1 条@simistern · 历史来源1 条@southpkcommons · 历史来源1 条@sriramkri · 历史来源1 条@sshoaibali · 历史来源1 条@stalkermustang · 历史来源1 条@status_effects · 历史来源1 条@stevencheng · 历史来源1 条@stockanalystpro · 历史来源1 条@suekhim · 历史来源1 条@sultanalfardan · 历史来源1 条@suraj_sharma14 · 历史来源1 条@swisscheese4299 · 历史来源1 条@swmansion · 历史来源1 条@systematicls · 历史来源1 条@teksedge · 历史来源1 条@tftc21 · 历史来源1 条@theahmadosman · 历史来源1 条@themidasproj · 历史来源1 条@theonejvo · 历史来源1 条@therealadamg · 历史来源1 条@timsoulo · 历史来源1 条@tmuxvim · 历史来源1 条@tobi · 历史来源1 条@togethercompute · 历史来源1 条@trackernetwork · 历史来源1 条@trustkerneltech · 历史来源1 条@ttunguz · 历史来源1 条@tuhinchakr · 历史来源1 条@twistartups · 历史来源1 条@ubermenscchh · 历史来源1 条@udayan_w · 历史来源1 条@usefastlane · 历史来源1 条@uzyn · 历史来源1 条@valeriocapraro · 历史来源1 条@vasuman · 历史来源1 条@vdbergrianne · 历史来源1 条@vibeguessing · 历史来源1 条@victoriakimse · 历史来源1 条@victoriawu77 · 历史来源1 条@victortaelin · 历史来源1 条@vikaskansalhq · 历史来源1 条@volchika · 历史来源1 条@walden_yan · 历史来源1 条@warpdotdev · 历史来源1 条@waynesutton · 历史来源1 条@wesroth · 历史来源1 条@whosamberella · 历史来源1 条@xdinodeer · 历史来源1 条@xicilion · 历史来源1 条@xucian_ · 历史来源1 条@yacinemtb · 历史来源1 条@yaojingang · 历史来源1 条@yevr19 · 历史来源1 条@yoheinakajima · 历史来源1 条@yongquanyq · 历史来源1 条@youtubejocoding · 历史来源1 条@yusufg · 历史来源1 条@zachbussey · 历史来源1 条@zeddotdev · 历史来源1 条@zeroxkyle · 历史来源1 条@zhenthebuilder · 历史来源1 条@zicohacks · 历史来源1 条@zixuanli_ · 历史来源1 条@zymazza · 历史来源1 条
15,370 条AI 相关新闻 · 最新在前
8月19日周三
  1. @rohanpaul_ai38

    Synthefy 展示 Nori 表格基础模型并非黑箱:可探测其预测、量化各特征贡献,并重建为透明的加性模型。在信用违约案例中,仅 23 个特征中的 6 个就恢复了约 95% 的全模型准确率,同时显示哪些输入推高或拉低预测。这意味着可先用强大预训练模型发现信号,再将其转化为可逐特征检查的小模型,对信用、保险、医疗等领域兼顾预测强度与可解释性。

  2. @testingcatalog66

    OpenAI 表示已暂停最新部署模型的强化学习(RL)训练两周,期间加固研究环境、开展红队测试并扩大监控覆盖。其规模最大的前沿 RL 训练仍处搁置,等待小规模训练与评测验证安全措施、积累更多对齐证据后再推进。转发该消息的 Testing Catalog 称,OpenAI 是首个宣布暂停训练的 AI 实验室,其他实验室可能跟进。

    引用@OpenAI@OpenAI

    As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment. https://t.co/ecbMMmVoox

    推荐理由:OpenAI 说明为安全与对齐暂停两周前沿 RL 训练,读者可了解头部实验室推进部署前如何调整训练节奏。

  3. @rohanpaul_ai78

    OpenAI 暂停了两周面向部署的 RL 训练,规模最大的前沿 RL 运行仍在搁置。Astra 未参与此前的 Hugging Face 事件,但其独立评测结果让 OpenAI 表示无法排除 Critical 阈值。研究负载此后需接受更强的沙箱、更紧的网络访问、更少的共享服务和持续安全测试,监控范围也扩展到内部活动与工具调用。

    引用@OpenAI@OpenAI

    As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment. https://t.co/ecbMMmVoox

    推荐理由:OpenAI 因 Astra 评测可能触及自主零日攻击的 Critical 阈值而暂停前沿 RL 训练,读者可看到其研究环境安全门槛的变化。

  4. @kimmonismus38

    你指着那堆乱糟糟的地方说“把这清理了”。这就是全部说明书。 Matic 刚刚发布了这个。没有 App,不用画地图,没有菜单。机器人能听懂 70 多种语言,看着你手指的方向,然后开到那个位置。说“跟着我”,它就会跟着你走进下一个房间。所有这些都在机器人本机上运行,所以 WiFi 关掉也能用。 九年只做一件事:一台你像跟狗说话一样对它说、而它真的会听的机器。@maticrobots

    原始视频预览图;未保存可播放视频URL
  5. @kimmonismus73

    OpenAI 暂停了最新部署模型的强化学习训练两周,最大规模的前沿 RL 运行仍处搁置状态,期间只开展小规模训练与评估,以验证模型行为、安全防护和对齐证据。作者称初步结论显示即将推出的 Astra 模型可能已达到 OpenAI 的 Critical 网络安全阈值,并提及 OpenAI 与 Hugging Face 事件,认为 Astra 短期内不会发布。

    引用@OpenAI@OpenAI

    As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment. https://t.co/ecbMMmVoox

    推荐理由:OpenAI 暂停最新部署模型的 RL 训练并披露 Astra 或触及 Critical 网络安全阈值,可据此了解前沿模型发布前的安全审查流程。

  6. @OpenAI65

    OpenAI 表示已暂时暂停其最新待部署模型的强化学习(RL)训练两周,期间加固研究环境、开展红队测试并扩大监控覆盖。规模最大的一次前沿 RL 训练仍处于暂停状态,等待小规模训练与评估验证这些防护措施,并积累更多对齐证据。

    推荐理由:OpenAI 披露暂停 RL 训练两周并扩大监控,读者可借此了解前沿模型内部开发阶段的安全管控安排。

  7. @kimmonismus27

    3/ 完整闭环是规划、构建、测试、审查、合并。你用两个链接和一句话设定目标,在任何东西被构建之前,规划会先返回给你审批。从那里开始,你以例外方式监督。如果有什么偏离,你就纠正它。如果没有,你就批准结果。 那个规划审批步骤比听起来更重要。正是在这里,你以一条消息的代价抓住一个错误理解,而不是浪费一个下午。

  8. @omarsar056

    Artificial Analysis 发布 Search Index,在开源智能体框架 Stirrup 中用同一模型 GPT-5.6 Luna(medium)对比 Parallel、Exa、Firecrawl 等 7 家搜索 API 的质量、成本与速度。上线时排行榜覆盖 11 项结果,Parallel、Exa、Firecrawl 的 Search Index 得分分别为 75、74、73,仅靠模型自身作答的基线为 33,接入搜索后各服务商得分在 65 至 75 之间。转发该消息的 @omarsar0 表示搜索是给智能体最重要的工具之一,他自己使用 Exa 与 Firecrawl 的组合。

    引用@ArtificialAnlys@ArtificialAnlys

    Announcing the Artificial Analysis Search Index, benchmarking how search API providers perform on quality, cost, and speed when used by an agent. We are initiating coverage with Parallel, Exa, Firecrawl, You (dot) com, Tavily, Keenable, and Brave Search is one of the most important tools for agents. Search providers make different choices about how they search, rank, and package results, and those choices change what the model reads and how it acts. We are expanding our benchmarking coverage to search APIs, so developers can pick a search provider on measured quality, cost, and speed. Each provider result pairs a search API provider with the same model, GPT-5.6 Luna (medium). The model runs inside Stirrup, our open-source agent harness, with tools for searching and fetching pages from the web - only the search provider behind the search tool changes. At launch, the leaderboard covers 11 results across 7 search providers, and we’ll keep expanding coverage as we look to provide the most accurate and comprehensive benchmarking of search providers for AI agent usage. Key elements of the Artificial Analysis Search Index: ➤ Three equally weighted benchmarks: the Search Index is the average of DeepSearchQA (900 broad research questions that need many searches, graded with an F1 score over answer items), BrowseComp (a 200-sample hard subset of facts that need multi-hop browsing), and AA-Omniscience (a 600 question private subset, balanced across 6 domains) ➤ Same agent, different search provider: the agent has 25 turns available to complete each task. Its web search tool returns the search provider's native response payload (with content modes standardized to snippets), with a maximum of 10 results and contamination sources filtered out ➤ Model-only baseline: we compare search agent results to the same model answering single-shot without tools, showing how much each provider lifts the model above its internal knowledge ➤ Cost and Time per Task: we aggregate the time and cost spent on both model inference and search. This is key - search APIs have different cost and latency structures, but these can be offset where they help an agent use fewer turns and save on costly language model inference Key results: ➤ Parallel, Exa, and Firecrawl have the strongest overall performance, with Artificial Analysis Search Index scores of 75, 74, and 73 respectively at launch ➤ All search providers tested substantially improve knowledge-based benchmark performance: the model only baseline scores 33 on the Search Index, while search-included provider results score between 65 and 75 ➤ Focused search results reduce spend on model inference: Parallel Search (advanced) search costs more per task than Parallel Search (basic) but less per task in total ($0.084 vs $0.11). Higher quality results cut the model's token use by over 40% in this case, more than offsetting increased search costs while reaching higher benchmark scores ➤ Fast search calls do not guarantee fast tasks: Parallel Search (turbo) has the fastest average search calls among Parallel's tiers (0.51s per query vs 1.03s for Parallel Search (basic)) but the basic tier scores higher on quality (73 vs 67) and the two land close on total time per task