做用户调研最怕什么?不是问卷发不出去

PromptCube 初级 4小时前 288 浏览 2 点赞 约 3 分钟

MatrAIx 这东西,直白说就是把「真人用户」换成「合成用户」跑模拟。你把问卷、聊天脚本、网页原型、甚至 App 流程扔进去,它帮你生成几百个带人设的虚拟受访者,几分钟跑完你原本要两周才能拿到的数据量。

核心逻辑:人设驱动 + 行为模拟

不是简单让 LLM 填表。它的架构里有三层:

1. Persona Layer:你可以用自然语言定义人设,比如「30 岁、一线城市、月薪 25k、焦虑型完美主义者、每天刷小红书 2 小时、对订阅制付费敏感」。它会基于这个画像生成一套内部一致的隐性变量(风险偏好、决策风格、认知偏差等)。
2. Interaction Engine:针对不同任务类型走不同逻辑。
- Survey:模拟阅读时长、跳题概率、李克特量表的中心倾向/极端倾向、甚至「直线答」检测。
- Chat:保持上下文记忆,模拟真人会中途跑题、情绪化回复、追问细节、甚至骂客服。
- Web/App:这块最硬核。它不是只看 DOM 抓选择器,而是结合视觉语言模型(VLM)做「看屏幕 -> 理解任务 -> 决策点击/输入/滑动」的闭环。你给个 Figma 链接或 staging 环境 URL,它能跑完整的注册-登录-下单-投诉流程,还能截图记录每一步决策理由。
3. Consistency Check:跑完自动做一致性校验,把前后矛盾、逻辑不通的样本标红剔除,直接出干净报表。

我实测的两个场景

场景一:新功能定价敏感度测试
本来要找调研公司招 200 人做 Van Westendorp 价格敏感度模型,报价 3 万起步、两周出报告。我用 MatrAIx 导入了 5 个核心用户画像,每人设跑 50 个样本,总共 250 份问卷,12 分钟跑完。导出的 CSV 直接能算 PSM 模型,最优定价区间和调研公司去年给的结论重合度 92%。省下的不止是钱,是那两周的等待焦虑。

场景二:电商 App 改版流失节点定位
产品想把「加入购物车」按钮从右下角浮层挪到商品详情页中间固定栏。我不想上灰度。丢给 MatrAIx 两个版本的 staging 链接,各跑 100 个「价格敏感型比价党」人设。旧版完成下单均耗时 4 分 12 秒,新版 3 分 48 秒;但新版在「优惠券领取」步骤异常退出率飙升 18%(VLM 识别出是浮层遮挡了关闭按钮)。这 bug 真上线大概率得被运营骂死,提前拦住了。

踩坑提醒

  • 别指望它替你做战略决策。它模拟的是「微观行为」,不懂「宏观趋势」。问「明年要不要做 AI 硬件」这种事,虚拟用户胡扯比真人还离谱。
  • 人设写得烂,数据全是毒。偷懒写「普通用户」那种泛泛画像,出来的分布就是标准正态分布,啥洞察都没有。必须写具体的痛点、场景、口头禅、甚至「上周刚被拼多多砍一刀失败过」这种细节。
  • Web/App 模式对环境敏感。staging 环境要稳定,加载超时、接口报错、验证码拦截都会让 Agent 卡死。建议先跑无头模式调通选择器/VLM 提示词,再挂大批量。
  • 数据导出格式目前只支持 CSV/JSON,想直接对接 Amplitude/Mixpanel 还得自己写脚本 ETL 一下。

部署成本

支持 Docker Compose 一键拉起,核心依赖是 PostgreSQL + Redis + 推理服务(默认挂 vLLM 跑开源模型,也能配 OpenAI/Anthropic Key)。我用 2 张 A100 40G 跑 70B 模型,并发 50 个虚拟用户跑 Web 任务,GPU 利用率稳在 65% 左右,成本可控。如果只是跑 Survey/Chat 文本任务,量化后的 7B/14B 模型在单张 3090/4090 上就能跑飞起。

适合谁?

  • 需要快速验证假设、不想等真实流量的产品经理/增长黑客
  • 做用研预算有限、样本难招的早期创业团队
  • 想在上线前用「合成压测」拦住明显交互 Bug 的前端/全栈

不适合:需要发表学术论文引用的严谨社会学研究、涉及高隐私/高风险医疗金融决策的合规场景。


项目开源在 GitHub,文

同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。

全部回复 (3)

内卷王调参侠 中级 4小时前
这生成的合成用户,能不能跑出真人那种「看不懂界面、瞎点乱填」的真实脏数据?
0 回复
小Kevin在路上 中级 4小时前
拿来测定价页,合成用户比真人还敢买贵方案
0 回复
独立开发者Leo 专家 4小时前
最大的坑是:它不会像真人那样中途弃坑跑路
0 回复

发表回复

支持 Markdown 格式