01 · 证据账本
每位受访者,都从真实声音开始。
02 · 数据基础
把真实数据塑造成可用的受访者面板。
Market Pilot 根据问题寻找合适来源,为本次研究构建受访者面板,并始终保留证据链。
RedditYouTubeXWeChatTelegramZhihuRedditYouTubeXWeChatTelegramZhihuRedditYouTubeXWeChatTelegramZhihuRedditYouTubeXWeChatTelegramZhihuRedditYouTubeXWeChatTelegramZhihuRedditYouTubeXWeChatTelegramZhihu
TikTokInstagramREDnoteDiscordBilibiliQuoraTikTokInstagramREDnoteDiscordBilibiliQuoraTikTokInstagramREDnoteDiscordBilibiliQuoraTikTokInstagramREDnoteDiscordBilibiliQuoraTikTokInstagramREDnoteDiscordBilibiliQuoraTikTokInstagramREDnoteDiscordBilibiliQuora
公开社交数据
把主流平台的公开讨论转化为证据丰富的受访者画像。
深度访谈
当动机、语言和细节比数量更重要时,引入访谈材料。
私域面板
使用第一方数据,为自己的品类建立可复用受访者基础。
0+
数据来源平台
0+
每次研究的受访者
0%
可追溯主张
03 · 双循环
一个受访者基础,两套运行循环。
离线循环把源材料转为受访者池;实时循环针对每个研究问题复用该池,并在 LLM 判断前执行确定性检查。
离线
数据侧
步骤 01
采集
公开声音、作者语境与评论证据
步骤 02
清洗
确定性本地规则,可逆且可审计
步骤 03
提取画像
只有证据存在时才由 LLM 推断
步骤 04
组装智能体
移除空画像并构建受访者基础
200+
受访者智能体
每个智能体都保留来源证据、置信度和 NA 边界。
实时
运行侧
步骤 01
范围门控
检查问题是否可以回答
步骤 02
证据门控
检查样本是否足够强
步骤 03
逐人作答
让每个回答关联画像证据
步骤 04
聚合与脱敏
交付前掩码敏感细节
确定性代码LLM 判断无支持时标 NA
04 · 数据治理
受访者来自提取,而不是编造。
原始社交数据必须经过严格处理才能用于研究;生成任何回答前,数据会通过多层治理。
01
噪声控制
移除占位符、空反应和纯符号回复,同时保留可审计的过滤记录。
02
证据三元组
每个画像字段都保存值、置信度与来源证据;没有支持的字段保持 NA。
03
受访者基础
排除零信号画像;每位保留的受访者都锚定真实语言与语境。
05 · 可信护城河
系统为什么能够保持诚实。
NA 纪律
其他工具总会回答。Market Pilot 可以说:“证据不足。”
双重门控
范围门判断问题能否回答,能力门判断证据是否足够。
NA 纪律
缺少证据就标记 NA;较薄的答案胜过自信的幻觉。
受访者规则
智能体只从画像语境推断态度,每个回答都必须关联证据。
定向脱敏
系统内可追溯,产品中保护隐私;手机号、昵称和敏感细节按规则脱敏。
06 · 证据回溯
从报告中的一句话,点回它的证据。
可追溯性被写进工作流:最终主张、受访者态度、证据行和脱敏规则必须彼此一致。
market-pilot / traceback演示 · 隐私安全 · 证据可追溯
报告主张
降价焦虑是该样本中最强烈的负面信号。
这句话不是凭直觉写成的,必须从最终报告回溯到聚合态度,再回到受访者证据。
1聚合主张
2受访者态度
3来源证据
4面向用户的脱敏
证据 01置信度 0.92已脱敏
提车三个月就降了两万多,早知道就等了。打 138****6021 也没解决。
允许的推断
从直接表达的不满中推断对降价的态度。
禁止的推断
不得编造收入、家庭状态或预算;没有支持的字段保持 NA。
