AI / MODELS & EXPERIENCES
AI 大模型评测
从能力对比到实际作品,再到日常使用中的真实感受。
01 / MODEL BENCHMARK
模型综合榜
多站评测汇总,查看模型在不同配置下的表现。
试算参数
完整榜单 69 个模型
| 模型 | 高性能模式 | 低性能模式 |
|---|---|---|
| 84.31 | 65.70仅 AA 参考 | |
| 81.45 | 73.11仅 AA 参考 | |
| 78.48 | 69.00仅 AA 参考 | |
| 74.57 | — | |
| 73.30 | — | |
| 68.57 | — | |
| 66.03 | 35.43仅 AA 参考 | |
| 64.20 | — | |
| 63.74 | — | |
| 62.55 | 35.43仅 AA 参考 | |
| 61.93 | — | |
| 60.56 | — | |
| 58.40 | — | |
| 57.13 | — | |
| 56.80 | 47.50仅 AA 参考 |
收录范围与未入榜资料
当前纳入 69 个版本、82 个计算节点 (82 个高/低模式、0 个原配置)。312 个版本暂未入榜,另有 4 个版本仅部分模式或配置符合准入。 未纳入共 318 个节点。原始评测继续保留。
DeepSeek V4 Flash · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- 非最大思考配置屎山考核:第 4 名
Qwen3.8-Max · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式发现 AA 候选条目,但版本或配置尚未精确匹配
原始配置与名次 · 2 项配置
- 非最大思考配置屎山考核:第 4 名
- xhigh逻辑 · 估计视图:第 17 名;逻辑 · 报告排名:第 17 名
SWE-2 · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- max · devin前端原生总榜:第 4 名
Qwen3.8-Flash · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 2 项配置
- xhigh · qoder前端原生总榜:第 6 名
- xhigh逻辑 · 估计视图:第 21 名;逻辑 · 报告排名:第 21 名
Dots3-note-prev · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- 未注明档位 · zcode前端原生总榜:第 12 名
Seed-2.1-pro 0915 · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
- 低性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 2 项配置
- high逻辑 · 估计视图:第 11 名;逻辑 · 报告排名:第 11 名
- 无推理逻辑 · 估计视图:第 52 名;逻辑 · 报告排名:第 52 名
Gemini 3.1 Pro · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- high逻辑 · 估计视图:第 13 名;逻辑 · 报告排名:第 13 名
Seed-2.1-pro · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
- 低性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 2 项配置
- high逻辑 · 估计视图:第 23 名;逻辑 · 报告排名:第 23 名
- 无推理逻辑 · 估计视图:第 53 名;逻辑 · 报告排名:第 53 名
Gemini 3.7 Flash · 暂未纳入部分配置
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 低性能模式上游有估计指数,尚未批准作为正式基准
原始配置与名次 · 1 项配置
- low逻辑 · 估计视图:第 24 名;逻辑 · 报告排名:第 24 名
Qwen3.7-Plus · 暂未纳入部分配置
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 低性能模式来源明确 non-reasoning 档;该版本 AA 已收录档位为 未披露。原始配置没有同档 AA 记录,另在性能模式审核共享基准;fallback 不是排除原因
原始配置与名次 · 1 项配置
- 无推理逻辑 · 估计视图:第 42 名;逻辑 · 报告排名:第 42 名
Seed-2.0-lite 0428 · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- high逻辑 · 估计视图:第 32 名;逻辑 · 报告排名:第 32 名
Opus 5 · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 低性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- 无推理逻辑 · 估计视图:第 33 名;逻辑 · 报告排名:第 33 名
Spark X2.5 · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式该性能模式尚无合格 AA 基准,保留原始资料,不参与正式计算
原始配置与名次 · 1 项配置
- 默认配置逻辑 · 估计视图:第 35 名;逻辑 · 报告排名:第 35 名
Ling-3.0-flash · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式上游有估计指数,尚未批准作为正式基准
原始配置与名次 · 1 项配置
- 默认配置逻辑 · 估计视图:第 36 名;逻辑 · 报告排名:第 36 名
Gemma 4 31B · 暂未纳入排名
暂未纳入 MYhao 计算:缺少可用的 AA 基准。
- 高性能模式上游有估计指数,尚未批准作为正式基准
原始配置与名次 · 1 项配置
- 默认配置逻辑 · 估计视图:第 38 名;逻辑 · 报告排名:第 38 名
数据来源与计算说明
当前正式榜仅比较具有合格 AA 基准的模型性能模式,并非所有现存模型的完整排名。 缺少基准的记录保留归档,不进入比较图、预算或拟合;上游估计值仅沿用已批准范围。
依据各站排名综合估计,优先按高性能模式排序,仅有低模式时采用该模式分数。AA 提供能力基准,网站权重同时作用于该站各领域。
同一模型版本按高、低性能模式汇总评测;同模式共享 AA 基准,原始配置保留在详情中。 未披露档位沿用 AA 最佳配置假设,仍无法确认时按人工规则归高。 模式分不是最佳或最低边界;只有 AA 锚点时注明“仅 AA 参考”,缺失数据不补分。
02 / MADE WITH AI
作品示例总览
看看模型能力,如何变成可以使用的作品。
作品用于展示应用思路,不作为模型胜负证据。具体使用模型尚未核实;封面为文字占位,实机预览待补充。
03 / PERSONAL NOTES
个人使用评测
记录具体场景里的体验、取舍与局限。
模型专项评测待补充,先收录已有的 AI 工具实践笔记。个人体验是否计入综合排名尚未确定,当前文章不参与榜单计算。
- 个人实践 · 学习笔记
Claude Code 自定义技能开发指南
深入理解 Claude Code 自定义技能(Skills)的设计与开发:从 SKILL.md 的结构设计、分类组织策略,到工作流程记录器和 GitHub 项目维护两个实战技能的完整拆解。
出处:本站学习笔记 · Claude Code + Markdown + Git
- 个人实践 · 学习笔记
CLI-Anything 项目可行性分析
分析 CLI-Anything 项目的定位、适用边界与前瞻性——让 AI Agent 调用专业软件引擎的务实方案。
出处:本站学习笔记 · CLI-Anything
外部资料会在对应内容旁标注出处;个人体验单独注明使用场景。每篇专项评测的参考资料将在详情页汇总。
