用户研究需要多少人?别把“5个用户”当成万能答案主题视觉

用户研究需要多少人?别把“5个用户”当成万能答案

作者:界达设计公司 阅读时间:约 8 分钟

“找5个人测一下”有时是合理的起点,有时会让团队得到非常危险的自信。样本量不是由研究方法的名字决定,而是由你想知道什么、用户差异有多大、结论需要多精确,以及错误决定的成本共同决定。

“找5个人测一下”有时是合理的起点,有时会让团队得到非常危险的自信。样本量不是由研究方法的名字决定,而是由你想知道什么、用户差异有多大、结论需要多精确,以及错误决定的成本共同决定。

01 先分清两类目标:发现问题,还是估计比例

定性研究通常关注“有哪些问题、为什么发生、用户如何理解”;量化研究关注“有多少人、差异多大、是否稳定”。前者需要覆盖关键差异并接近信息饱和,后者需要足够样本控制误差和支持比较。

目标典型问题样本判断依据错误做法
发现问题用户为什么卡住?有哪些未满足需求?关键人群覆盖、问题发现率、信息饱和用人数直接证明市场比例
比较方案A方案是否比B方案更好?预期差异、波动、置信与统计功效样本太少却宣布“显著提升”
估计指标成功率、满意度、使用频率是多少?允许误差、置信水平、总体差异只看平均值,不看区间
持续迭代这轮是否还存在高风险问题?每轮目标、问题严重度、重复测试一次招很多人,等开发完成才测试

02 不同方法的实务起点

下面的数字是项目规划的起点,不是行业统一标准。用户群越异质、任务越复杂、决策风险越高,越需要增加样本或分轮验证。

研究方法常见起点什么时候需要增加主要产出
探索性访谈每个关键人群先5—8人仍持续出现新主题;角色、市场或经验差异明显需求、动机、语言和情境
形成性可用性测试每个相对同质人群每轮5—8人流程高风险、问题发生率低或需覆盖辅助技术用户发现问题并快速迭代
量化可用性基准通常20—40人以上再评估精度需要比较版本、分组或更窄误差成功率、时间、量表分数及区间
问卷调查依据总体、比例、误差和分组计算要比较地区、客户层级或角色态度、比例与关联关系
卡片分类/树测试探索可从30—50人起,稳定结构常需更多内容复杂、分群明显或要做统计聚类分类心智与导航可发现性

访谈做到什么时候可以停?看饱和度,不只看人数的视觉化说明

03 访谈做到什么时候可以停?看饱和度,不只看人数

所谓饱和,不是连续两位用户说了相同的话,而是新访谈已经很少改变关键主题、用户差异和决策判断。团队可以在每场访谈后记录:是否出现新主题;是否补充了已知主题的条件;是否推翻了原假设;是否改变产品决策。

访谈编号新主题补充条件是否改变决策是否继续招募
1—3较多较多是继续
4—6减少仍有关键差异部分补齐特定人群
7—8极少多为重复证据否可暂停并验证

如果项目有管理员、普通成员、审批人和外部客户四种角色,不能用总共5人覆盖全部角色后声称“已经饱和”。饱和应在研究问题相关的关键分群内判断。

04 为什么“5个用户能发现85%问题”不能机械套用

这个经典结论建立在特定的问题发生概率和发现目标上。现实项目中的问题并不都以相同概率出现:权限异常、退款失败、辅助技术兼容或低频高风险流程,可能需要特定人群和更多场景才能暴露。

形成性测试更适合“小样本、多轮次”:每轮测试明确流程,修复高风险问题,再测下一轮。相比一次性找20个用户测试同一个明显缺陷,5—8人一轮、连续三轮通常更能帮助设计迭代。

量化研究要算的是精度,不是凑一个整数的视觉化说明

05 量化研究要算的是精度,不是凑一个整数

如果要估计任务成功率、满意度或问卷比例,样本量要围绕可接受误差来设计。样本越小,区间越宽;想把误差缩小一半,通常需要大约四倍样本。

例如10人中有8人完成任务,不等于总体成功率就是80%。小样本的置信区间会很宽,适合发现明显问题,不适合精确对外宣布指标。若要比较两个版本,还应先确定最小值得关注的差异,并据此做功效计算。

06 用户分群会让样本量迅速增加

很多项目说“我们招20个人”,实际却要比较新老用户、管理者与成员、国内与海外、手机与桌面四组。分组后每组只剩两三人,既没有定性覆盖,也无法量化比较。

先删掉不必要的比较,再增加样本。研究设计不是把所有差异都装进一次测试,而是选择这次决策真正需要的差异。

用风险决定投入,而不是所有问题同一规格的视觉化说明

07 用风险决定投入,而不是所有问题同一规格

决策风险示例建议研究策略
低风险、可回滚按钮文案、信息顺序小样本快速测试,上线后看行为数据
中风险、影响核心转化注册、试用、购买流程多轮可用性测试+关键指标验证
高风险、涉及资金或合规支付、借贷、医疗、权限覆盖异常场景和特殊人群,增加专家与量化验证
长期战略决策新市场、新产品定位多方法、多分群与阶段性研究

08 招募质量比多找几个人更重要

  • 用真实或高度相似的目标用户,避免全靠同事和朋友。
  • 招募条件围绕行为与经验,不要只按年龄和性别。
  • 记录角色、使用频率、设备、权限和关键背景,便于解释差异。
  • 预留10%—20%的替补,应对爽约、资格不符和技术问题。
  • 对特殊人群、辅助技术或专业角色,优先保证匹配而不是追求大样本。

09 三个常见项目怎么定样本

场景一:改版企业官网询盘表单

先用访问数据和客服记录定位问题,再招5—8位真实目标客户做任务测试。若不同市场使用习惯差异明显,应分别覆盖。改版上线后观察表单开始率、完成率、有效线索率和错误。

场景二:评估B端系统新审批流程

至少覆盖发起人、审批人和管理员,不要把所有角色混成一组。每个关键角色可先5人左右一轮,重点验证状态、权限、退回和异常;若要量化比较效率,需要进一步扩大样本。

场景三:用问卷估计客户满意度

先明确总体、预期回复率、允许误差和需要比较的客户层级,再计算样本。若最终只收到少量回复,应诚实报告样本与偏差,不把结果包装成全部客户意见。

常见问题

用户访谈做6个人够不够?

若问题聚焦、用户相对同质且新主题已经明显减少,6人可能足以形成下一步假设;若包含多角色、多市场或复杂流程,则远远不够。

可用性测试一定是5个人吗?

不是。5人是常见的形成性起点,适合快速发现高频问题。低频、高风险、分群复杂或需要量化指标时,应增加样本或分轮测试。

问卷至少要100份才有效吗?

没有固定门槛。100份可能足够回答某些粗略问题,也可能无法支持多个分组比较。应根据总体、预期比例、误差和分析方式计算。

样本少,研究还有价值吗?

有,但要用对结论。小样本可以发现问题、生成假设和理解情境,不应被用来精确估计比例或代表全部用户。

服务查看
UI/UX设计服务查看服务详情
项目咨询联系界达设计
设计与建站文章阅读更多相关文章
链接复制成功

从想法到落地,我们一起完成

以用户体验为核心,打造真正可用、可增长的数字产品

和我谈谈您的项目