AI / MODELS & EXPERIENCES

AI 大模型评测

从能力对比到实际作品,再到日常使用中的真实感受。

5 评测平台数据快照

01 / MODEL BENCHMARK

模型综合榜

多站评测汇总,查看模型在不同配置下的表现。

AA 准入榜
模型分类
评测维度
MYhao 排名 · 20 个模型高性能模式 低性能模式
完整榜单 69 个模型
模型高性能模式低性能模式
84.3165.70仅 AA 参考
81.4573.11仅 AA 参考
78.4869.00仅 AA 参考
74.57—
73.30—
68.57—
66.0335.43仅 AA 参考
64.20—
63.74—
62.5535.43仅 AA 参考
61.93—
60.56—
58.40—
57.13—
56.8047.50仅 AA 参考
1 / 5
收录范围与未入榜资料

当前纳入 69 个版本、82 个计算节点 (82 个高/低模式、0 个原配置)。312 个版本暂未入榜,另有 4 个版本仅部分模式或配置符合准入。 未纳入共 318 个节点。原始评测继续保留。

DeepSeek V4 Flash · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • 非最大思考配置屎山考核:第 4 名
Qwen3.8-Max · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式发现 AA 候选条目,但版本或配置尚未精确匹配
原始配置与名次 · 2 项配置
  • 非最大思考配置屎山考核:第 4 名
  • xhigh逻辑 · 估计视图:第 17 名;逻辑 · 报告排名:第 17 名
SWE-2 · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • max · devin前端原生总榜:第 4 名
Qwen3.8-Flash · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 2 项配置
  • xhigh · qoder前端原生总榜:第 6 名
  • xhigh逻辑 · 估计视图:第 21 名;逻辑 · 报告排名:第 21 名
Dots3-note-prev · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • 未注明档位 · zcode前端原生总榜:第 12 名
Seed-2.1-pro 0915 · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
  • 低性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 2 项配置
  • high逻辑 · 估计视图:第 11 名;逻辑 · 报告排名:第 11 名
  • 无推理逻辑 · 估计视图:第 52 名;逻辑 · 报告排名:第 52 名
Gemini 3.1 Pro · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • high逻辑 · 估计视图:第 13 名;逻辑 · 报告排名:第 13 名
Seed-2.1-pro · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
  • 低性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 2 项配置
  • high逻辑 · 估计视图:第 23 名;逻辑 · 报告排名:第 23 名
  • 无推理逻辑 · 估计视图:第 53 名;逻辑 · 报告排名:第 53 名
Gemini 3.7 Flash · 暂未纳入部分配置

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 低性能模式上游有估计指数,尚未批准作为正式基准
原始配置与名次 · 1 项配置
  • low逻辑 · 估计视图:第 24 名;逻辑 · 报告排名:第 24 名
Qwen3.7-Plus · 暂未纳入部分配置

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 低性能模式来源明确 non-reasoning 档;该版本 AA 已收录档位为 未披露。原始配置没有同档 AA 记录,另在性能模式审核共享基准;fallback 不是排除原因
原始配置与名次 · 1 项配置
  • 无推理逻辑 · 估计视图:第 42 名;逻辑 · 报告排名:第 42 名
Seed-2.0-lite 0428 · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • high逻辑 · 估计视图:第 32 名;逻辑 · 报告排名:第 32 名
Opus 5 · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 低性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • 无推理逻辑 · 估计视图:第 33 名;逻辑 · 报告排名:第 33 名
Spark X2.5 · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
  • 默认配置逻辑 · 估计视图:第 35 名;逻辑 · 报告排名:第 35 名
Ling-3.0-flash · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式上游有估计指数,尚未批准作为正式基准
原始配置与名次 · 1 项配置
  • 默认配置逻辑 · 估计视图:第 36 名;逻辑 · 报告排名:第 36 名
Gemma 4 31B · 暂未纳入排名

暂未纳入 MYhao 计算:缺少可用的 AA 基准。

  • 高性能模式上游有估计指数,尚未批准作为正式基准
原始配置与名次 · 1 项配置
  • 默认配置逻辑 · 估计视图:第 38 名;逻辑 · 报告排名:第 38 名
1 / 22
数据来源与计算说明

当前正式榜仅比较具有合格 AA 基准的模型性能模式,并非所有现存模型的完整排名。 缺少基准的记录保留归档,不进入比较图、预算或拟合;上游估计值仅沿用已批准范围。

依据各站排名综合估计,优先按高性能模式排序,仅有低模式时采用该模式分数。AA 提供能力基准,网站权重同时作用于该站各领域。

同一模型版本按高、低性能模式汇总评测;同模式共享 AA 基准,原始配置保留在详情中。 未披露档位沿用 AA 最佳配置假设,仍无法确认时按人工规则归高。 模式分不是最佳或最低边界;只有 AA 锚点时注明“仅 AA 参考”,缺失数据不补分。

02 / MADE WITH AI

作品示例总览

看看模型能力,如何变成可以使用的作品。

开发者作品 · 独立于榜单

作品用于展示应用思路,不作为模型胜负证据。具体使用模型尚未核实;封面为文字占位,实机预览待补充。

绘图工具

DrawMind

开发者分享的绘图工具项目,可从作者介绍与代码仓库了解作品。

作者:不会喷火的小火龙 / sz-xiaohuolong

收录出处 / 作者介绍 ↗

03 / PERSONAL NOTES

个人使用评测

记录具体场景里的体验、取舍与局限。

个人实践 / 独立于外部榜单

模型专项评测待补充,先收录已有的 AI 工具实践笔记。个人体验是否计入综合排名尚未确定,当前文章不参与榜单计算。

  • Claude Code 自定义技能开发指南

    深入理解 Claude Code 自定义技能(Skills)的设计与开发:从 SKILL.md 的结构设计、分类组织策略,到工作流程记录器和 GitHub 项目维护两个实战技能的完整拆解。

    出处:本站学习笔记 · Claude Code + Markdown + Git

  • CLI-Anything 项目可行性分析

    分析 CLI-Anything 项目的定位、适用边界与前瞻性——让 AI Agent 调用专业软件引擎的务实方案。

    出处:本站学习笔记 · CLI-Anything

外部资料会在对应内容旁标注出处;个人体验单独注明使用场景。每篇专项评测的参考资料将在详情页汇总。