公众号 公众号二维码 扫码关注公众号 AI工具导航 投稿
登录 注册 退出

标签:大模型评测

共 8 篇文章
三款旗舰模型的“账本”:GPT-6 Sol、Claude Opus 5.5与Grok 4.7怎么选 AI

三款旗舰模型的“账本”:GPT-6 Sol、Claude Opus 5.5与Grok 4.7怎么选

对比GPT-6 Sol、Claude Opus 5.5与Grok 4.7三款旗舰模型定价与基准表现。厂商自报分数与第三方跑分存在系统性差距,选型应看单任务成本。...

讯场网 3小时前 646 阅读
院士团队联手给医疗大模型立了把尺子:MedBench 5.0正式发布 AI

院士团队联手给医疗大模型立了把尺子:MedBench 5.0正式发布

7月31日,上海人工智能实验室联合钟南山、葛均波院士团队发布MedBench 5.0医疗AI评测体系。新版本首创医疗原子技能评测范式,将临床任务拆解为五大能力维......

普思AI资讯 1个月前 16 阅读
Claude Opus 5深度评测:半价追平Fable 5,Anthropic这波把旗舰定价逻辑打穿了 AI

Claude Opus 5深度评测:半价追平Fable 5,Anthropic这波把旗舰定价逻辑打穿了

7月25日Anthropic发布Claude Opus 5,定价与Opus 4.8持平(5/25美元),性能对标Fable 5,价格仅一半。Frontier-B......

普思AI资讯 2个月前 48 阅读
Gemini 3.6 Flash评测:Token省了17%,智能指数原地踏步,用户为什么不买账? AI

Gemini 3.6 Flash评测:Token省了17%,智能指数原地踏步,用户为什么不买账?

7月21日谷歌发布Gemini 3.6 Flash,输出Token减少17%、价格降至7.5美元/百万Token,DeepSWE等基准测试有提升。但Artifi......

普思AI资讯 2个月前 16 阅读