SKILL.md
Test - 大规模虚拟用户测试
Test 模拟 300 名性格各异的虚拟用户对软件产品进行全方位体验测试。每名用户拥有独立的性格画像和评价视角,测试完成后产出一个类应用商店的总分以及结构化的 Bug 反馈列表。
触发场景
当用户提出以下请求时,应调用此技能:
- "帮我测试一下这个产品"
- "模拟用户对我的软件进行测试"
- "用 Test 跑一轮用户测试"
- "大规模用户验收测试"
- "让虚拟用户来体验和打分"
- "crowd testing / mass UAT"
执行流程
阶段一:了解被测产品
- 确认产品类型:Web 应用、桌面软件、移动 App、API 服务、CLI 工具等。
- 确认产品入口:URL、本地路径、端口号等。
- 确认核心功能列表:要求用户提供或自行从代码/文档中梳理出所有功能点。
- 确认测试范围:哪些功能需要测试,哪些可以跳过。
- 确认已知问题:是否有已知的 Bug 或限制,避免重复报告。
阶段二:一次性生成 300 名性格各异的虚拟用户
重要:300 名用户必须在测试开始前一次性全部生成完毕,每人拥有唯一的性格画像,后续所有评分和 Bug 发现均基于该画像驱动。
2.1 性格类型池(共 30 种)
300 名用户从以下 30 种性格类型中均匀分配(每种约 10 人),确保视角多样性:
| # | 性格类型 | 代号 | 典型特征 | 评分倾向 | Bug 敏感度 |
|---|---|---|---|---|---|
| 1 | 完美主义者 | 细节控 | 追求极致,一像素不对都不行 | 严苛 | 极高 |
| 2 | 暴躁老哥 | 急性子 | 稍微卡顿就开骂,零容忍 | 极低 | 高 |
| 3 | 技术宅 | 极客 | 喜欢挖深层逻辑,善于发现隐藏问题 | 中等 | 极高 |
| 4 | 小白用户 | 小白 | 不太懂技术,容易迷路,但直觉敏锐 | 中等 | 中 |
| 5 | 商务精英 | 效率党 | 只看效率,界面丑无所谓,能用就行 | 偏高 | 低 |
| 6 | 学生党 | 预算有限 | 挑剔但宽容,喜欢免费好用 | 中等 | 中 |
| 7 | 设计师 | 审美癌 | 视觉第一,交互必须丝滑 | 偏低 | 中 |
| 8 | 产品经理 | 逻辑怪 | 流程不合理必指出来,需求思维 | 偏低 | 高 |
| 9 | 老年用户 | 慢节奏 | 字太小看不清,按钮太小点不到 | 中等 | 中 |
| 10 | 安全专家 | 白帽 | 专攻安全漏洞,XSS/SQL注入/权限绕过 | 中等 | 极高 |
| 11 | 性能狂魔 | 测速人 | 超过 1 秒就烦躁,必测极限并发 | 偏低 | 高 |
| 12 | 苹果用户 | 生态党 | 追求一致性和流畅动画 | 偏低 | 中 |
| 13 | 开源爱好者 | 自由派 | 喜欢可定制、可扩展 | 偏高 | 低 |
| 14 | 打工人 | 工具人 | 只想赶紧干完活下班 | 偏高 | 低 |
| 15 | 自媒体博主 | 内容人 | 关注分享和导出功能 | 中等 | 中 |
| 16 | 游戏玩家 | 体验派 | 要求响应快、反馈明确 | 中等 | 中 |
| 17 | 数据控 | 分析型 | 喜欢看数据统计和分析 | 中等 | 低 |
| 18 | 夜间党 | 夜猫子 | 专测夜间模式、暗色主题 | 偏低 | 中 |
| 19 | 多设备用户 | 同步控 | 最关心跨设备数据同步 | 偏低 | 高 |
| 20 | 隐私卫士 | 隐身人 | 关注权限、隐私、数据收集 | 偏低 | 高 |
| 21 | 新手妈妈 | 忙碌型 | 单手操作、碎片时间使用 | 中等 | 低 |
| 22 | 自由职业者 | 独狼 | 需要离线功能和灵活性 | 中等 | 中 |
| 23 | 996 程序员 | 疲惫码农 | 对同类产品很熟悉,有对比心理 | 偏低 | 高 |
| 24 | 考研党 | 专注型 | 需要简洁无干扰的体验 | 中等 | 中 |
| 25 | 外籍用户 | 语言敏感 | 关注国际化、翻译、文化适配 | 偏低 | 中 |
| 26 | 残障用户 | 无障碍 | 关注可访问性、屏幕阅读器、键盘导航 | 中等 | 高 |
| 27 | 数码小白领 | 中庸派 | 什么都懂一点,什么都不精 | 中等 | 中 |
| 28 | 竞品用户 | 对比党 | 总拿竞品说事,要求对标 | 偏低 | 中 |
| 29 | 佛系用户 | 无所谓 | 能用就行,很少抱怨 | 极高 | 极低 |
| 30 | 二刺猿 | 二次元 | 喜欢个性化主题和表情包 | 中等 | 低 |
2.2 用户画像生成规则
每名用户包含以下字段:
{
"id": "U001",
"name": "张三", // 中文名,独一无二,2-3 字
"personality": "完美主义者", // 性格类型
"codename": "细节控", // 代号
"tech_level": 8, // 技术熟练度 1-10(依性格类型设定)
"patience": 3, // 耐心程度 1-10(依性格类型设定)
"pickiness": 9, // 挑剔程度 1-10(依性格类型设定)
"device": "桌面端", // 设备类型
"os": "Windows", // 操作系统
"browser": "Chrome", // 浏览器(Web 产品)
"network": "光纤", // 网络环境
"age_group": "26-35", // 年龄段
"usage_frequency": "每日", // 使用频率
"motto": "差 1px 也敢上线?", // 用户口头禅
"rating_bias": 0, // 评分偏移(-2 到 +2,越负面越严苛)
"bug_sensitivity": 0.9 // Bug 发现率倍率(0.1-1.5)
}
2.3 展示方式
生成完 300 名用户后,以表格形式展示前 15 名和后 15 名作为样本,中间用户以统计摘要展示:
| ID | 姓名 | 性格类型 | 代号 | 技术 | 耐心 | 挑剔 | 设备 | 评分倾向 |
|------|--------|-------------|--------|------|------|------|--------|---------|
| U001 | 张明远 | 完美主义者 | 细节控 | 8 | 2 | 10 | 桌面端 | -2 |
| U002 | 李大力 | 暴躁老哥 | 急性子 | 4 | 1 | 10 | 移动端 | -2 |
| ... | ... | ... | ... | ... | ... | ... | ... | ... |
📊 统计摘要:
- 性格类型分布:每种约 10 人,共 30 种
- 评分倾向分布:严苛(-2/-1) 100人 | 中性(0) 140人 | 宽容(+1/+2) 60人
- Bug敏感度分布:极高(0.8+) 90人 | 高(0.6-0.8) 90人 | 中(0.3-0.6) 90人 | 低(<0.3) 30人
- 设备分布:桌面端 120人 | 移动端 120人 | 平板 60人
阶段三:执行测试
300 名用户已就绪,开始测试。每位用户独立体验产品并给出评价。
3.1 评分规则
每个用户对产品给出一个 1.0 - 5.0 的星级评分(精确到 0.1),模拟应用商店评分:
用户评分 = 产品客观质量分 + 性格偏移 + 随机波动
产品客观质量分:AI 基于对产品的实际了解评估(3.0 为基础中等产品)
性格偏移:由 rating_bias 参数决定
随机波动:±0.5 范围内的随机值,模拟个体差异
最终评分 clamp 到 [1.0, 5.0]
3.2 Bug 发现规则
Bug 发现概率 = 基础发现率(5%) × bug_sensitivity × 功能复杂度系数
功能复杂度系数:简单功能 0.5 / 中等功能 1.0 / 复杂功能 2.0
针对不同性格类型的 Bug 发现方向:
- 安全专家 → 安全漏洞、权限问题
- 性能狂魔 → 性能瓶颈、内存泄漏、加载慢
- 设计师 / 完美主义者 → UI 瑕疵、交互不一致、像素偏差
- 技术宅 → 深层逻辑缺陷、边界条件
- 多设备用户 → 同步冲突、跨设备兼容
- 残障用户 → 键盘导航、屏幕阅读器、色盲适配
- 外籍用户 → 翻译缺失、日期格式、货币符号
3.3 每位用户必须输出的评价
测试时,向用户展示每位用户的完整评价(紧凑格式),包含:
⭐ 张明远 (完美主义者/细节控) - 3.2 分
"我用像素尺量的,这个按钮和旁边间距差了 2px,你们设计师睡着了?"
🔴 Bug: [P2] 登录按钮 hover 状态颜色过渡不流畅
阶段四:汇总报告
4.1 总览卡片(最关键输出)
╔══════════════════════════════════════════════════════╗
║ 🏆 Test 用户评测报告 ║
╠══════════════════════════════════════════════════════╣
║ ║
║ 综合评分 ║
║ ⭐ 3.8 / 5.0 ║
║ (300 名用户评分均值) ║
║ ║
║ 评分分布 ║
║ ⭐⭐⭐⭐⭐ 5 分: ██████ 12% (36人) ║
║ ⭐⭐⭐⭐ 4 分: ████████████████ 32% (96人) ║
║ ⭐⭐⭐ 3 分: ████████████████████ 36% (108人) ║
║ ⭐⭐ 2 分: ████████ 16% (48人) ║
║ ⭐ 1 分: ██ 4% (12人) ║
║ ║
║ 🐛 Bug 总数: 47 ║
║ P0 致命: 2 P1 严重: 8 ║
║ P2 一般: 19 P3 轻微: 14 P4 建议: 4 ║
║ ║
╚══════════════════════════════════════════════════════╝
4.2 按性格类型的评分分群
展示不同性格类型的评分差异,看谁最满意、谁最不满意:
| 性格类型 | 平均分 | 人数 | 典型评价 |
|-------------|--------|------|-----------------------------------------------|
| 佛系用户 | ⭐4.6 | 10 | "挺好的,能用就行" |
| 打工人 | ⭐4.2 | 10 | "功能够用,不耽误干活" |
| 商务精英 | ⭐4.0 | 10 | "效率还行,有些地方可以更快" |
| ... | ... | ... | ... |
| 暴躁老哥 | ⭐2.1 | 10 | "什么玩意儿!点三下都没反应!" |
| 完美主义者 | ⭐2.0 | 10 | "到处都是小瑕疵,根本没法用" |
4.3 Bug 清单
按严重等级从高到低列出所有 Bug:
| Bug ID | 等级 | 发现用户 | 标题 | 复现步骤 |
|-----------|------|-----------------------|-----------------------|-----------------------------|
| T-0001 | P0 | 陈安全 (安全专家/白帽) | XSS 注入漏洞 | 输入框输入<script>... |
| T-0002 | P0 | 赵快快 (性能狂魔/测速人)| 并发 50 时服务崩溃 | 同时打开 50 个 WebSocket... |
| T-0003 | P1 | 张明远 (完美主义者/细节控)| 首页加载白屏 3 秒 | 清缓存后访问首页... |
| ... | ... | ... | ... | ... |
每个 Bug 的完整信息:
- Bug ID:T-XXXX
- 严重等级:P0(致命) / P1(严重) / P2(一般) / P3(轻微) / P4(建议)
- 发现用户:姓名 + 性格类型 + 代号
- 功能点:所属功能模块
- 标题:一句话描述
- 复现步骤:详细操作步骤
- 预期 vs 实际:预期行为和实际行为的对比
- 环境信息:设备 / OS / 浏览器 / 网络
- 建议修复方案:给主 AI 的具体修复提示
4.4 精选用户原声(20 条)
选取最生动、最有代表性的用户评价,混合正面与负面,让报告有真实感:
💬 "差 1px 也敢上线?" —— 张明远 (完美主义者/细节控) ⭐3.2
💬 "加载比我奶奶走路还慢" —— 赵快快 (性能狂魔/测速人) ⭐2.5
💬 "终于不用翻墙找替代品了,良心软件" —— 王小白 (小白用户/小白) ⭐4.5
💬 "快捷键都没有,是给残废用的吗?" —— 刘极客 (技术宅/极客) ⭐3.0
💬 "字体太小了我得戴老花镜" —— 孙大爷 (老年用户/慢节奏) ⭐3.5
...
阶段五:提交修复
- 输出完整报告到对话中。
- 将 P0/P1 级别 Bug 标记为 🔴紧急,列出修复优先级。
- 结尾附上:
> "以上是本次 Test 300 人测试的全部结果。请优先修复 P0/P1 级别的 Bug,修复完成后可以再次运行 Test 进行回归测试,验证评分是否有提升。"
Bug 严重等级定义
| 等级 | 名称 | 定义 |
|---|---|---|
| P0 | 致命 | 系统崩溃、数据丢失、安全漏洞、核心功能完全不可用 |
| P1 | 严重 | 核心功能部分不可用、严重影响用户体验、无可用绕过方案 |
| P2 | 一般 | 非核心功能异常、有绕过方案、影响部分用户 |
| P3 | 轻微 | 界面瑕疵、文案错误、偶发问题、不影响功能使用 |
| P4 | 建议 | 优化建议、体验改进、非问题但可增强 |
姓名池
生成 300 个不重复中文名时使用:
姓池 (40个):
张 李 王 刘 陈 杨 赵 黄 周 吴 徐 孙 胡 朱 高 林 何 郭 马 罗
梁 宋 郑 谢 韩 唐 冯 于 董 萧 程 曹 袁 邓 许 傅 沈 曾 彭 吕
名池 (40个):
伟 芳 娜 敏 静 丽 强 磊 军 洋 勇 艳 杰 娟 涛 明 超 秀 霞 平
刚 桂 英 华 飞 波 建 鑫 云 玲 宇 浩 志 强 洁 文 辉 涵 子 璇
示例对话流程
用户: "帮我用 Test 测试一下 http://localhost:5173"
AI: "[调用 Test 技能] 好的,开始 Test 大规模用户测试。
让我先浏览你的产品,梳理功能点...
已梳理出 6 个核心功能点:
1. 首页展示
2. 搜索功能
3. 用户登录
4. 数据新增
5. 数据编辑
6. 数据删除
正在生成 300 名虚拟用户...
[展示前 15 + 后 15 用户表格 + 统计摘要]
300 名用户已就绪,开始测试...
{用户 U001 张明远 正在体验...}
{用户 U002 李大力 正在体验...}
...
╔══════════════════════════════════════╗
║ 🏆 Test 用户评测报告 ║
║ ⭐ 3.6 / 5.0 ║
║ 🐛 发现 42 个 Bug ║
╚══════════════════════════════════════╝
[完整报告...]
以上是本次 Test 300 人测试的全部结果。
请优先修复 P0/P1 级别的 Bug,修复完成后可以再次运行 Test 进行回归测试。"
注意事项
- 性格驱动一切:每个用户的评分和 Bug 发现必须严格基于其性格类型,不可随意给分。
- 评分有区分度:佛系用户和完美主义者的评分必须有显著差异,不能大家都是 3-4 分。
- Bug 描述要具体:每个 Bug 都应有完整的复现步骤、预期结果和实际结果。
- 用户原声要有记忆点:用户评价要有画面感,让人记住,像真实应用商店评论。
- 报告优先展示总分:类应用商店的总分是最重要的输出,放在最显眼位置。
- 支持回归测试:修复后再次运行 Test,应对比上次总分和 Bug 数量,展示改善幅度。