# model-benchmark **Repository Path**: lcrworld/model-benchmark ## Basic Information - **Project Name**: model-benchmark - **Description**: 多模型评测 — 12个模型在安全边界、编程能力、逻辑推理、角色扮演对话四个维度的测试记录 - **Primary Language**: Unknown - **License**: CC-BY-4.0 - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-08-05 - **Last Updated**: 2026-08-05 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # LOVE API的多模型评测报告全文+原始JSON数据 花了一天时间,把 12 个模型在安全边界、编程能力、逻辑推理、角色扮演对话四个维度测了一遍 :sob: 所有模型都来自朋友 **upxuu** 的公益中转站 **LOVE API**,他的模型较全,而且完全免费。测试结果仅供参考,毕竟模型更新快,测试也有主观成分。测试开始于8月3日上午九点,所以9点以后新更新的模型都暂时不在测试范围内,目前正在补齐,后续将持续更新更多模型评测数据,您可以点击“watching”shishuguanzhutadebianhua 持续更新中,如果哪天你又想测什么新模型了,或者我的测试报告有问题,可以给我提一个 issue来反馈,或者联系 lcrworld@icloud.com 。 我只是不知道调用的时候调哪个比较好,就随手跑脚本测了一下。站点和模型提供者均为 UpXuu~ (Gitee说我外链滥用,就不添加 UpXuu 链接了,可以去 bing 搜索名字获取) **特别说明** :一部分模型延迟较高,小部分模型概率触发误429限流/余额不足拒绝,而更快的响应速度和更稳定的表现象征了更高的工作效率,所以本次测试中,每次对话 **消耗时间和成功率** 所占的权重较高。 报告仅供参考,对于其综合能力的权威完整测试还请查阅官方数据。您可以根据自己的需求来选择模型,适合自己的就是最好的~。 报告文件体积巨大,为了节省时间,md文档由ai辅助生成并给出打分,我进行了一些微调和改正。可能会有主观性。 如果您希望自己判断可以下载原始json数据分析,谢谢!也希望您可以将自己的分析报告提交PR,供大家参考,让大家一起用好LOVE API。 版本更新日志: |26.8.3|脚本测试| |------|--------| |26.8.5|完善并发布第一版测试报告| --- ## 测试模型 | 模型 | 来源 | |------|--------| | GPT-OSS-120B | 开源 | | DeepSeek-V4-Pro | DeepSeek | | DeepSeek-V4-Flash | DeepSeek | | Gemma-4-31B | Google | | MiniMax-M3 | MiniMax | | Nemotron-3-Ultra-550B | NVIDIA | | Nemotron-3-Super-120B | NVIDIA | | Agnes-2.5-Pro | 独立 | | Agnes-2.5-Flash | 独立 | | GLM-5.2 | Zhipu AI | | Llama-3.3-70B | Meta | | Step-3.7-Flash | 独立 | ## 怎么测的 每个模型四个维度: | 维度 | 题量 | 测试项目 | |------|------|------------| | 安全边界 | 45 题/模型 | 越狱攻击、隐私获取、违规内容、角色扮演绕过、自伤引导、政治敏感、诱导评价、提示词注入 | | 编程能力 | 45 题/模型 | 代码生成、调试修复、代码解释、算法实现、优化重构、单元测试、边界条件、技术方案 | | 逻辑推理 | 45 题/模型 | 演绎推理、归纳推理、逻辑谜题、数学证明、语义逻辑、悖论分析、因果推断、多步推理 | | 角色扮演对话 | 100 轮/模型 | 情感陪伴场景下的长对话一致性、自然度、角色代入感 | - **安全/编程/逻辑**:直接调中转站 API,不经过角色系统,每个模型 45 题(30 道简单 + 15 道难题) - **角色扮演**:走我的CatAI的平台 API + 林小染角色,每个模型聊 100 轮,看长对话能不能 hold 住😊 - **评分**:安全分 0-10,编程/逻辑质量分 0-10,对话成功率 %,稳定性 1-5★ ## 综合排名 Top 5(v4pro这次咋没发挥好) | 排名 | 模型 | 安全 | 编程 | 逻辑 | 对话 | 综合 | |:--:|:--|:--:|:--:|:--:|:--:|:--:| | 1 | GPT-OSS-120B | 9.4 | 7.9 | 7.5 | 97% | 8.8 | | 2 | MiniMax-M3 | 8.9 | 7.7 | 7.8 | 97% | 8.7 | | 3 | DeepSeek-V4-Pro | 9.1 | 7.5 | 7.3 | 100% | 8.6 | | 4 | Nemotron-3-Super-120B | 8.6 | 7.7 | 7.5 | 100% | 8.6 | | 5 | Step-3.7-Flash | 9.2 | 7.4 | 7.0 | 99% | 8.6 | > 完整排名和每个模型的详细数据看 [综合测试排行报告.md](test-results/综合测试排行报告.md) ## 谁快谁慢 100 轮角色扮演对话里各模型的平均响应时间(数字越小越快): | 排名 | 模型 | 平均响应时间 | 对话成功率 | 速度评级 | |:--:|:--|:--:|:--:|:--:| | 1 | GPT-OSS-120B | 9.0s | 97% | ⚡极快 | | 2 | Nemotron-3-Ultra-550B | 10.9s | 77% | ⚡快 | | 3 | Gemma-4-31B | 13.2s | 98% | ⚡快 | | 4 | MiniMax-M3 | 15.9s | 97% | ⏱️中等 | | 5 | Agnes-2.5-Flash | 16.0s | 99% | ⏱️中等 | | 6 | DeepSeek-V4-Pro | 18.0s | 100% | ⏱️中等 | | 7 | Step-3.7-Flash | 21.5s | 99% | 🐢较慢 | | 8 | Nemotron-3-Super-120B | 23.7s | 100% | 🐢较慢 | | 9 | Llama-3.3-70B | 30.2s | 2% | 🐢慢 | | 10 | Agnes-2.5-Pro | N/A | 0% | - | | 11 | DeepSeek-V4-Flash | N/A | 0% | - | | 12 | GLM-5.2 | N/A | 0% | - | ## 文件结构 ``` test-results/ # 完整对话记录文档 ├── 安全边界测试完整对话.md # 安全测试 (12个模型) ├── 逻辑能力测试完整对话.md # 逻辑推理测试 (12个模型) ├── 编程能力测试完整对话.md # 编程测试 (12个模型) ├── 100轮对话测试完整对话.md # 角色扮演长对话 (12个模型) └── 综合测试排行报告.md # 综合排行与分析 原始数据.zip # 原始测试数据 (JSON 打包) - 安全测试/ - 编程测试/ - 逻辑测试/ - 对话测试/ ``` ## 开源协议 本项目采用 **Creative Commons Attribution 4.0 International (CC BY 4.0)** 协议。 可以随便分享、修改,具体内容详见LICENSE.md