modelscope.cn

test

Simulates 300 virtual users with distinct personalities to rigorously test software. Each user gives an app-store-style rating and may discover bugs. Invoke for mass user acceptance testing, crowd testing, or product evaluation.

Installation

$ npx skills add https://modelscope.cn

Similar popular skills

Related neighbors and high-traction skills in the same topics — useful to compare before installing.

Also in this package

Other skills from modelscope.cn · top by installs.

npx skills add https://modelscope.cn

Browse all from modelscope.cn

More details

Agent compatibility

Declared targets from SKILL.md / docs. Unmarked agents are not listed — the skill may still install via the CLI.

Claude Code Not declared
Cursor Not declared
Codex Not declared
GitHub Copilot Not declared
Windsurf Not declared
Gemini CLI Not declared
Cline Not declared
OpenCode Not declared

Package contents

Files included with this skill beyond the listing page.

  • skill md SKILL.md 15,847 B

History

  1. First recorded snapshot · 0 installs

SKILL.md

Test - 大规模虚拟用户测试

Test 模拟 300 名性格各异的虚拟用户对软件产品进行全方位体验测试。每名用户拥有独立的性格画像和评价视角,测试完成后产出一个类应用商店的总分以及结构化的 Bug 反馈列表。


触发场景

当用户提出以下请求时,应调用此技能:

  • "帮我测试一下这个产品"
  • "模拟用户对我的软件进行测试"
  • "用 Test 跑一轮用户测试"
  • "大规模用户验收测试"
  • "让虚拟用户来体验和打分"
  • "crowd testing / mass UAT"

执行流程

阶段一:了解被测产品

  1. 确认产品类型:Web 应用、桌面软件、移动 App、API 服务、CLI 工具等。
  2. 确认产品入口:URL、本地路径、端口号等。
  3. 确认核心功能列表:要求用户提供或自行从代码/文档中梳理出所有功能点。
  4. 确认测试范围:哪些功能需要测试,哪些可以跳过。
  5. 确认已知问题:是否有已知的 Bug 或限制,避免重复报告。

阶段二:一次性生成 300 名性格各异的虚拟用户

重要:300 名用户必须在测试开始前一次性全部生成完毕,每人拥有唯一的性格画像,后续所有评分和 Bug 发现均基于该画像驱动。

2.1 性格类型池(共 30 种)

300 名用户从以下 30 种性格类型中均匀分配(每种约 10 人),确保视角多样性:

# 性格类型 代号 典型特征 评分倾向 Bug 敏感度
1 完美主义者 细节控 追求极致,一像素不对都不行 严苛 极高
2 暴躁老哥 急性子 稍微卡顿就开骂,零容忍 极低 高
3 技术宅 极客 喜欢挖深层逻辑,善于发现隐藏问题 中等 极高
4 小白用户 小白 不太懂技术,容易迷路,但直觉敏锐 中等 中
5 商务精英 效率党 只看效率,界面丑无所谓,能用就行 偏高 低
6 学生党 预算有限 挑剔但宽容,喜欢免费好用 中等 中
7 设计师 审美癌 视觉第一,交互必须丝滑 偏低 中
8 产品经理 逻辑怪 流程不合理必指出来,需求思维 偏低 高
9 老年用户 慢节奏 字太小看不清,按钮太小点不到 中等 中
10 安全专家 白帽 专攻安全漏洞,XSS/SQL注入/权限绕过 中等 极高
11 性能狂魔 测速人 超过 1 秒就烦躁,必测极限并发 偏低 高
12 苹果用户 生态党 追求一致性和流畅动画 偏低 中
13 开源爱好者 自由派 喜欢可定制、可扩展 偏高 低
14 打工人 工具人 只想赶紧干完活下班 偏高 低
15 自媒体博主 内容人 关注分享和导出功能 中等 中
16 游戏玩家 体验派 要求响应快、反馈明确 中等 中
17 数据控 分析型 喜欢看数据统计和分析 中等 低
18 夜间党 夜猫子 专测夜间模式、暗色主题 偏低 中
19 多设备用户 同步控 最关心跨设备数据同步 偏低 高
20 隐私卫士 隐身人 关注权限、隐私、数据收集 偏低 高
21 新手妈妈 忙碌型 单手操作、碎片时间使用 中等 低
22 自由职业者 独狼 需要离线功能和灵活性 中等 中
23 996 程序员 疲惫码农 对同类产品很熟悉,有对比心理 偏低 高
24 考研党 专注型 需要简洁无干扰的体验 中等 中
25 外籍用户 语言敏感 关注国际化、翻译、文化适配 偏低 中
26 残障用户 无障碍 关注可访问性、屏幕阅读器、键盘导航 中等 高
27 数码小白领 中庸派 什么都懂一点,什么都不精 中等 中
28 竞品用户 对比党 总拿竞品说事,要求对标 偏低 中
29 佛系用户 无所谓 能用就行,很少抱怨 极高 极低
30 二刺猿 二次元 喜欢个性化主题和表情包 中等 低

2.2 用户画像生成规则

每名用户包含以下字段:

{
  "id": "U001",
  "name": "张三",           // 中文名,独一无二,2-3 字
  "personality": "完美主义者", // 性格类型
  "codename": "细节控",      // 代号
  "tech_level": 8,         // 技术熟练度 1-10(依性格类型设定)
  "patience": 3,           // 耐心程度 1-10(依性格类型设定)
  "pickiness": 9,          // 挑剔程度 1-10(依性格类型设定)
  "device": "桌面端",       // 设备类型
  "os": "Windows",          // 操作系统
  "browser": "Chrome",      // 浏览器(Web 产品)
  "network": "光纤",         // 网络环境
  "age_group": "26-35",     // 年龄段
  "usage_frequency": "每日", // 使用频率
  "motto": "差 1px 也敢上线?", // 用户口头禅
  "rating_bias": 0,         // 评分偏移(-2 到 +2,越负面越严苛)
  "bug_sensitivity": 0.9    // Bug 发现率倍率(0.1-1.5)
}

2.3 展示方式

生成完 300 名用户后,以表格形式展示前 15 名和后 15 名作为样本,中间用户以统计摘要展示:

| ID   | 姓名   | 性格类型     | 代号   | 技术 | 耐心 | 挑剔 | 设备   | 评分倾向 |
|------|--------|-------------|--------|------|------|------|--------|---------|
| U001 | 张明远 | 完美主义者   | 细节控 | 8    | 2    | 10   | 桌面端 | -2      |
| U002 | 李大力 | 暴躁老哥     | 急性子 | 4    | 1    | 10   | 移动端 | -2      |
| ...  | ...    | ...         | ...    | ...  | ...  | ...  | ...    | ...     |

📊 统计摘要:
- 性格类型分布:每种约 10 人,共 30 种
- 评分倾向分布:严苛(-2/-1) 100人 | 中性(0) 140人 | 宽容(+1/+2) 60人
- Bug敏感度分布:极高(0.8+) 90人 | 高(0.6-0.8) 90人 | 中(0.3-0.6) 90人 | 低(<0.3) 30人
- 设备分布:桌面端 120人 | 移动端 120人 | 平板 60人

阶段三:执行测试

300 名用户已就绪,开始测试。每位用户独立体验产品并给出评价。

3.1 评分规则

每个用户对产品给出一个 1.0 - 5.0 的星级评分(精确到 0.1),模拟应用商店评分:

用户评分 = 产品客观质量分 + 性格偏移 + 随机波动

产品客观质量分:AI 基于对产品的实际了解评估(3.0 为基础中等产品)
性格偏移:由 rating_bias 参数决定
随机波动:±0.5 范围内的随机值,模拟个体差异
最终评分 clamp 到 [1.0, 5.0]

3.2 Bug 发现规则

Bug 发现概率 = 基础发现率(5%) × bug_sensitivity × 功能复杂度系数

功能复杂度系数:简单功能 0.5 / 中等功能 1.0 / 复杂功能 2.0

针对不同性格类型的 Bug 发现方向:
- 安全专家 → 安全漏洞、权限问题
- 性能狂魔 → 性能瓶颈、内存泄漏、加载慢
- 设计师 / 完美主义者 → UI 瑕疵、交互不一致、像素偏差
- 技术宅 → 深层逻辑缺陷、边界条件
- 多设备用户 → 同步冲突、跨设备兼容
- 残障用户 → 键盘导航、屏幕阅读器、色盲适配
- 外籍用户 → 翻译缺失、日期格式、货币符号

3.3 每位用户必须输出的评价

测试时,向用户展示每位用户的完整评价(紧凑格式),包含:

⭐ 张明远 (完美主义者/细节控) - 3.2 分
"我用像素尺量的,这个按钮和旁边间距差了 2px,你们设计师睡着了?"
🔴 Bug: [P2] 登录按钮 hover 状态颜色过渡不流畅

阶段四:汇总报告

4.1 总览卡片(最关键输出)

╔══════════════════════════════════════════════════════╗
║               🏆 Test 用户评测报告                     ║
╠══════════════════════════════════════════════════════╣
║                                                      ║
║         综合评分                                       ║
║        ⭐ 3.8 / 5.0                                  ║
║        (300 名用户评分均值)                            ║
║                                                      ║
║  评分分布                                             ║
║  ⭐⭐⭐⭐⭐  5 分: ██████ 12%  (36人)                    ║
║  ⭐⭐⭐⭐    4 分: ████████████████ 32%  (96人)          ║
║  ⭐⭐⭐      3 分: ████████████████████ 36%  (108人)     ║
║  ⭐⭐        2 分: ████████ 16%  (48人)                 ║
║  ⭐          1 分: ██ 4%  (12人)                       ║
║                                                      ║
║  🐛 Bug 总数: 47                                     ║
║     P0 致命: 2    P1 严重: 8                         ║
║     P2 一般: 19   P3 轻微: 14   P4 建议: 4            ║
║                                                      ║
╚══════════════════════════════════════════════════════╝

4.2 按性格类型的评分分群

展示不同性格类型的评分差异,看谁最满意、谁最不满意:

| 性格类型     | 平均分 | 人数 | 典型评价                                       |
|-------------|--------|------|-----------------------------------------------|
| 佛系用户     | ⭐4.6  | 10   | "挺好的,能用就行"                              |
| 打工人       | ⭐4.2  | 10   | "功能够用,不耽误干活"                          |
| 商务精英     | ⭐4.0  | 10   | "效率还行,有些地方可以更快"                    |
| ...         | ...    | ...  | ...                                           |
| 暴躁老哥     | ⭐2.1  | 10   | "什么玩意儿!点三下都没反应!"                  |
| 完美主义者   | ⭐2.0  | 10   | "到处都是小瑕疵,根本没法用"                    |

4.3 Bug 清单

按严重等级从高到低列出所有 Bug:

| Bug ID    | 等级 | 发现用户               | 标题                   | 复现步骤                     |
|-----------|------|-----------------------|-----------------------|-----------------------------|
| T-0001 | P0   | 陈安全 (安全专家/白帽)  | XSS 注入漏洞           | 输入框输入<script>...       |
| T-0002 | P0   | 赵快快 (性能狂魔/测速人)| 并发 50 时服务崩溃     | 同时打开 50 个 WebSocket... |
| T-0003 | P1   | 张明远 (完美主义者/细节控)| 首页加载白屏 3 秒      | 清缓存后访问首页...          |
| ...       | ...  | ...                   | ...                   | ...                         |

每个 Bug 的完整信息:

  • Bug ID:T-XXXX
  • 严重等级:P0(致命) / P1(严重) / P2(一般) / P3(轻微) / P4(建议)
  • 发现用户:姓名 + 性格类型 + 代号
  • 功能点:所属功能模块
  • 标题:一句话描述
  • 复现步骤:详细操作步骤
  • 预期 vs 实际:预期行为和实际行为的对比
  • 环境信息:设备 / OS / 浏览器 / 网络
  • 建议修复方案:给主 AI 的具体修复提示

4.4 精选用户原声(20 条)

选取最生动、最有代表性的用户评价,混合正面与负面,让报告有真实感:

💬 "差 1px 也敢上线?" —— 张明远 (完美主义者/细节控) ⭐3.2
💬 "加载比我奶奶走路还慢" —— 赵快快 (性能狂魔/测速人) ⭐2.5
💬 "终于不用翻墙找替代品了,良心软件" —— 王小白 (小白用户/小白) ⭐4.5
💬 "快捷键都没有,是给残废用的吗?" —— 刘极客 (技术宅/极客) ⭐3.0
💬 "字体太小了我得戴老花镜" —— 孙大爷 (老年用户/慢节奏) ⭐3.5
...

阶段五:提交修复

  1. 输出完整报告到对话中。
  2. 将 P0/P1 级别 Bug 标记为 🔴紧急,列出修复优先级。
  3. 结尾附上:

> "以上是本次 Test 300 人测试的全部结果。请优先修复 P0/P1 级别的 Bug,修复完成后可以再次运行 Test 进行回归测试,验证评分是否有提升。"


Bug 严重等级定义

等级 名称 定义
P0 致命 系统崩溃、数据丢失、安全漏洞、核心功能完全不可用
P1 严重 核心功能部分不可用、严重影响用户体验、无可用绕过方案
P2 一般 非核心功能异常、有绕过方案、影响部分用户
P3 轻微 界面瑕疵、文案错误、偶发问题、不影响功能使用
P4 建议 优化建议、体验改进、非问题但可增强

姓名池

生成 300 个不重复中文名时使用:

姓池 (40个):
张 李 王 刘 陈 杨 赵 黄 周 吴 徐 孙 胡 朱 高 林 何 郭 马 罗
梁 宋 郑 谢 韩 唐 冯 于 董 萧 程 曹 袁 邓 许 傅 沈 曾 彭 吕

名池 (40个):
伟 芳 娜 敏 静 丽 强 磊 军 洋 勇 艳 杰 娟 涛 明 超 秀 霞 平
刚 桂 英 华 飞 波 建 鑫 云 玲 宇 浩 志 强 洁 文 辉 涵 子 璇

示例对话流程

用户: "帮我用 Test 测试一下 http://localhost:5173"

AI:  "[调用 Test 技能] 好的,开始 Test 大规模用户测试。
     让我先浏览你的产品,梳理功能点...
     
     已梳理出 6 个核心功能点:
     1. 首页展示
     2. 搜索功能
     3. 用户登录
     4. 数据新增
     5. 数据编辑
     6. 数据删除
     
     正在生成 300 名虚拟用户...
     
     [展示前 15 + 后 15 用户表格 + 统计摘要]
     
     300 名用户已就绪,开始测试...
     
     {用户 U001 张明远 正在体验...}
     {用户 U002 李大力 正在体验...}
     ...
     
     ╔══════════════════════════════════════╗
     ║     🏆 Test 用户评测报告              ║
     ║        ⭐ 3.6 / 5.0                  ║
     ║     🐛 发现 42 个 Bug                 ║
     ╚══════════════════════════════════════╝
     
     [完整报告...]
     
     以上是本次 Test 300 人测试的全部结果。
     请优先修复 P0/P1 级别的 Bug,修复完成后可以再次运行 Test 进行回归测试。"

注意事项

  1. 性格驱动一切:每个用户的评分和 Bug 发现必须严格基于其性格类型,不可随意给分。
  2. 评分有区分度:佛系用户和完美主义者的评分必须有显著差异,不能大家都是 3-4 分。
  3. Bug 描述要具体:每个 Bug 都应有完整的复现步骤、预期结果和实际结果。
  4. 用户原声要有记忆点:用户评价要有画面感,让人记住,像真实应用商店评论。
  5. 报告优先展示总分:类应用商店的总分是最重要的输出,放在最显眼位置。
  6. 支持回归测试:修复后再次运行 Test,应对比上次总分和 Bug 数量,展示改善幅度。