“找5个人测一下”有时是合理的起点,有时会让团队得到非常危险的自信。样本量不是由研究方法的名字决定,而是由你想知道什么、用户差异有多大、结论需要多精确,以及错误决定的成本共同决定。
“找5个人测一下”有时是合理的起点,有时会让团队得到非常危险的自信。样本量不是由研究方法的名字决定,而是由你想知道什么、用户差异有多大、结论需要多精确,以及错误决定的成本共同决定。
01 先分清两类目标:发现问题,还是估计比例
定性研究通常关注“有哪些问题、为什么发生、用户如何理解”;量化研究关注“有多少人、差异多大、是否稳定”。前者需要覆盖关键差异并接近信息饱和,后者需要足够样本控制误差和支持比较。
| 目标 | 典型问题 | 样本判断依据 | 错误做法 |
|---|---|---|---|
| 发现问题 | 用户为什么卡住?有哪些未满足需求? | 关键人群覆盖、问题发现率、信息饱和 | 用人数直接证明市场比例 |
| 比较方案 | A方案是否比B方案更好? | 预期差异、波动、置信与统计功效 | 样本太少却宣布“显著提升” |
| 估计指标 | 成功率、满意度、使用频率是多少? | 允许误差、置信水平、总体差异 | 只看平均值,不看区间 |
| 持续迭代 | 这轮是否还存在高风险问题? | 每轮目标、问题严重度、重复测试 | 一次招很多人,等开发完成才测试 |
02 不同方法的实务起点
下面的数字是项目规划的起点,不是行业统一标准。用户群越异质、任务越复杂、决策风险越高,越需要增加样本或分轮验证。
| 研究方法 | 常见起点 | 什么时候需要增加 | 主要产出 |
|---|---|---|---|
| 探索性访谈 | 每个关键人群先5—8人 | 仍持续出现新主题;角色、市场或经验差异明显 | 需求、动机、语言和情境 |
| 形成性可用性测试 | 每个相对同质人群每轮5—8人 | 流程高风险、问题发生率低或需覆盖辅助技术用户 | 发现问题并快速迭代 |
| 量化可用性基准 | 通常20—40人以上再评估精度 | 需要比较版本、分组或更窄误差 | 成功率、时间、量表分数及区间 |
| 问卷调查 | 依据总体、比例、误差和分组计算 | 要比较地区、客户层级或角色 | 态度、比例与关联关系 |
| 卡片分类/树测试 | 探索可从30—50人起,稳定结构常需更多 | 内容复杂、分群明显或要做统计聚类 | 分类心智与导航可发现性 |

03 访谈做到什么时候可以停?看饱和度,不只看人数
所谓饱和,不是连续两位用户说了相同的话,而是新访谈已经很少改变关键主题、用户差异和决策判断。团队可以在每场访谈后记录:是否出现新主题;是否补充了已知主题的条件;是否推翻了原假设;是否改变产品决策。
| 访谈编号 | 新主题 | 补充条件 | 是否改变决策 | 是否继续招募 |
|---|---|---|---|---|
| 1—3 | 较多 | 较多 | 是 | 继续 |
| 4—6 | 减少 | 仍有关键差异 | 部分 | 补齐特定人群 |
| 7—8 | 极少 | 多为重复证据 | 否 | 可暂停并验证 |
如果项目有管理员、普通成员、审批人和外部客户四种角色,不能用总共5人覆盖全部角色后声称“已经饱和”。饱和应在研究问题相关的关键分群内判断。
04 为什么“5个用户能发现85%问题”不能机械套用
这个经典结论建立在特定的问题发生概率和发现目标上。现实项目中的问题并不都以相同概率出现:权限异常、退款失败、辅助技术兼容或低频高风险流程,可能需要特定人群和更多场景才能暴露。
形成性测试更适合“小样本、多轮次”:每轮测试明确流程,修复高风险问题,再测下一轮。相比一次性找20个用户测试同一个明显缺陷,5—8人一轮、连续三轮通常更能帮助设计迭代。

05 量化研究要算的是精度,不是凑一个整数
如果要估计任务成功率、满意度或问卷比例,样本量要围绕可接受误差来设计。样本越小,区间越宽;想把误差缩小一半,通常需要大约四倍样本。
例如10人中有8人完成任务,不等于总体成功率就是80%。小样本的置信区间会很宽,适合发现明显问题,不适合精确对外宣布指标。若要比较两个版本,还应先确定最小值得关注的差异,并据此做功效计算。
06 用户分群会让样本量迅速增加
很多项目说“我们招20个人”,实际却要比较新老用户、管理者与成员、国内与海外、手机与桌面四组。分组后每组只剩两三人,既没有定性覆盖,也无法量化比较。
先删掉不必要的比较,再增加样本。研究设计不是把所有差异都装进一次测试,而是选择这次决策真正需要的差异。

07 用风险决定投入,而不是所有问题同一规格
| 决策风险 | 示例 | 建议研究策略 |
|---|---|---|
| 低风险、可回滚 | 按钮文案、信息顺序 | 小样本快速测试,上线后看行为数据 |
| 中风险、影响核心转化 | 注册、试用、购买流程 | 多轮可用性测试+关键指标验证 |
| 高风险、涉及资金或合规 | 支付、借贷、医疗、权限 | 覆盖异常场景和特殊人群,增加专家与量化验证 |
| 长期战略决策 | 新市场、新产品定位 | 多方法、多分群与阶段性研究 |
08 招募质量比多找几个人更重要
- 用真实或高度相似的目标用户,避免全靠同事和朋友。
- 招募条件围绕行为与经验,不要只按年龄和性别。
- 记录角色、使用频率、设备、权限和关键背景,便于解释差异。
- 预留10%—20%的替补,应对爽约、资格不符和技术问题。
- 对特殊人群、辅助技术或专业角色,优先保证匹配而不是追求大样本。
09 三个常见项目怎么定样本
场景一:改版企业官网询盘表单
先用访问数据和客服记录定位问题,再招5—8位真实目标客户做任务测试。若不同市场使用习惯差异明显,应分别覆盖。改版上线后观察表单开始率、完成率、有效线索率和错误。
场景二:评估B端系统新审批流程
至少覆盖发起人、审批人和管理员,不要把所有角色混成一组。每个关键角色可先5人左右一轮,重点验证状态、权限、退回和异常;若要量化比较效率,需要进一步扩大样本。
场景三:用问卷估计客户满意度
先明确总体、预期回复率、允许误差和需要比较的客户层级,再计算样本。若最终只收到少量回复,应诚实报告样本与偏差,不把结果包装成全部客户意见。
常见问题
用户访谈做6个人够不够?
若问题聚焦、用户相对同质且新主题已经明显减少,6人可能足以形成下一步假设;若包含多角色、多市场或复杂流程,则远远不够。
可用性测试一定是5个人吗?
不是。5人是常见的形成性起点,适合快速发现高频问题。低频、高风险、分群复杂或需要量化指标时,应增加样本或分轮测试。
问卷至少要100份才有效吗?
没有固定门槛。100份可能足够回答某些粗略问题,也可能无法支持多个分组比较。应根据总体、预期比例、误差和分析方式计算。
样本少,研究还有价值吗?
有,但要用对结论。小样本可以发现问题、生成假设和理解情境,不应被用来精确估计比例或代表全部用户。