公众号 公众号二维码 扫码关注公众号 AI工具导航 投稿
登录 注册 退出

深度评测

用真实任务实测大模型与AI产品:Qwen、DeepSeek、Claude等模型在编码、写作、推理场景的横评数据,帮你选对模型不踩坑——不吹不黑,只看效果。
Gemini 3.8 Flash 系列横向评测:常规 Flash 与 安全向 Flash Cyber

Gemini 3.8 Flash 系列横向评测:常规 Flash 与 安全向 Flash Cyber

3.8 Flash 同级定价却逼近高价旗舰,靠"多推理步数"换准确率;Flash Cyber 安全能力前沿但仅限防御者,二者是同一底座被两套......

讯场网 2天前 505 阅读 AI安全 Gemini 性价比
Claude Fable 5.1 实测:登顶智能指数,但每任务成本高了 20%

Claude Fable 5.1 实测:登顶智能指数,但每任务成本高了 20%

基于 Artificial Analysis 实测,Fable 5.1 在 max effort 下以 66 分登顶智能指数,但每任务成本较 Fable 5 高......

讯场网 2天前 506 阅读 AI性价比 Claude 模型评测
Mac成AI硬件宠儿:苹果提前发布2026款mini/Studio,开发者训练需求激增背后的真实图景

Mac成AI硬件宠儿:苹果提前发布2026款mini/Studio,开发者训练需求激增背后的真实图景

科技媒体The Information报道,全球越来越多AI实验室和开发者使用Mac训练和微调模型,苹果因此提前发布2026款Mac mini和Mac Stud......

讯场网 3天前 615 阅读 苹果 端侧AI AI开发
SGLang 实测 MiniMax-H3 视频生成:无损路径提速近 2 倍

SGLang 实测 MiniMax-H3 视频生成:无损路径提速近 2 倍

SGLang Diffusion 团队在 8H200 上实测 MiniMax-H3 视频生成,密集无损路径较 Diffusers 快 1.85–1.95 倍,启......

讯场网 4天前 8 阅读 视频生成 MiniMax
Mac Studio 本地跑 Qwen3.8 27B:14 tokens/s 的真实读数

Mac Studio 本地跑 Qwen3.8 27B:14 tokens/s 的真实读数

实测 Qwen3.8 27B(27.3B 参数、混合注意力、262144 上下文、Apache 2.0)在 Mac Studio M3 Ultra 经 Olla......

讯场网 4天前 3 阅读 Qwen
AI公司每赚100美元近40美元流向云巨头:算力成本结构深度拆解

AI公司每赚100美元近40美元流向云巨头:算力成本结构深度拆解

8月31日界面新闻AI早报报道,研究显示AI公司每赚100美元收入,就有近40美元流向云服务商。这个数据揭示了AI行业的一个核心矛盾:AI公司在快速增长的同时,......

讯场网 5天前 3 阅读 算力成本 云服务商 AI公司
DeepSeek涨价与中国大模型API价格战深度分析:从疯狂降价到理性回调,行业进入精算时代

DeepSeek涨价与中国大模型API价格战深度分析:从疯狂降价到理性回调,行业进入精算时代

8月30日蓝鲸新闻报道,DeepSeek在V4 Pro正式版上线的同一份公告里给出了新价格,标志着中国大模型API价格从疯狂降价进入理性回调阶段。统计字节跳动、......

讯场网 5天前 8 阅读 DeepSeek 大模型 API
Qwen3.8-Flash vs Claude Opus 4.6深度对比:60亿激活参数能否真正超越千亿密集模型

Qwen3.8-Flash vs Claude Opus 4.6深度对比:60亿激活参数能否真正超越千亿密集模型

阿里宣称Qwen3.8-Flash以60亿激活参数超越Claude Opus 4.6。本文从基准测试、推理能力、代码生成、多轮对话、中文能力、成本效率六个维度进......

普思 1星期前 3 阅读 Claude Qwen MoE
OpenAI Jalapeño vs 英伟达GB200/GB300深度对比:专用推理芯片能否颠覆通用GPU霸权?

OpenAI Jalapeño vs 英伟达GB200/GB300深度对比:专用推理芯片能否颠覆通用GPU霸权?

基于SemiAnalysis InferenceX公开基准的深度对比:OpenAI Jalapeño在每瓦工作量上达GB200/GB300的1.5-1.9倍,端......

AI资讯 1星期前 3 阅读 OpenAI 英伟达 AI芯片
Claude Opus 5 vs GPT-5.6 Sol终极横评:2026最强AI模型之争的全景解析

Claude Opus 5 vs GPT-5.6 Sol终极横评:2026最强AI模型之争的全景解析

2026年第30周大模型综合能力榜显示,Claude Opus 5(max)以60.7分登顶,Claude Fable 5(with fallback) 59.......

AI资讯 1星期前 10 阅读 Claude Opus 5 GPT-5.6 Sol DeepSWE
实测Qwen3.8预览版:2.4T参数仅次于Fable 5,但AI的“预览版”不能全信

实测Qwen3.8预览版:2.4T参数仅次于Fable 5,但AI的“预览版”不能全信

7月19日阿里发布Qwen3.8-Max-Preview,2.4T参数MoE架构,官方宣称“仅次于Fable 5”。实测基础编码扎实、全栈14文件一次跑通、Ag......

普思AI资讯 1个月前 21 阅读 阿里千问 Qwen3.8 大模型实测
三款国产大模型联手改造“屎山”:六轮实测,没有全能冠军

三款国产大模型联手改造“屎山”:六轮实测,没有全能冠军

硅星人让Kimi K3、Qwen 3.8-Max和GLM 5.2共同改造一个堆满历史遗留代码的网站。六轮真实任务实测——项目分析、报错修复、轮播实现、样式修改、......

普思AI资讯 1个月前 17 阅读 AI编程 国产大模型 代码重构