先看成果:走完这套流程你会拿到什么
不是"一份 AI 生成的小作文",而是四样能直接进汇报材料的东西:
1. 一份 15–25 页的结构化报告:市场边界、规模与增长驱动、竞争格局、典型客户与采购逻辑、政策与技术变量、风险与不确定性。
2. 一张引用清单:每条结论后面挂编号,编号对应「来源名称 + 文档类型 + 发布时间 + 链接」。
3. 一张事实核对表:区分「一手来源的数字」「二手转述的数字」「模型的推断」——推断必须显式标注,不能混进结论里。
4. 一份未解问题清单:Deep Research 找不到答案的地方,往往才是这份报告最值钱的部分,它告诉你下一步该打哪个电话、该买哪份付费报告。
下面用一个贯穿全程的例子:「工业设备预测性维护(PdM)在中小制造企业的落地情况」。这个题目够真实、够具体,也够窄——窄到能在一次调研里跑完。
整个流程大约 60–90 分钟,分四轮跑,不要试图一次问完。
前置条件清单
- 一个能联网检索的深度研究功能。ChatGPT、Gemini、Perplexity 以及国内若干产品都提供类似能力,名称和可用范围各产品不同,以各产品官方页面为准。关键是确认三点:能不能联网、会不会给出可点击的来源、单次任务能跑多久。
- 一个足够窄的研究问题。"AI 行业怎么样"这种题目跑出来的必然是废话,具体到"某类设备、某类客户、某个地区、某个时间段"才有产出。
- 一台能开一堆标签页的电脑。核验引用时你会同时打开十几个页面。
- 一个文档工具:飞书文档、Notion、Google Docs 都行,用来拼接和批注。
- 可选但强烈建议:手里已有的内部资料(销售反馈、客户访谈记录)。把内部信息喂进去,AI 才知道哪些外部结论和你的实际体感对不上。
- 时间预算:跑四轮大约 60–90 分钟,核验引用再花 30–60 分钟。
第一步:把「我想了解一下」拆成可检索的问题树
这是整件事里最重要的一步。研究质量的上限,在你写提示词之前就定下来了。
拆解的原则是:每一个子问题,都要能对应到"哪种文档会回答它"。如果你的子问题找不到对应的文档类型,说明它太抽象了。
以 PdM 为例,拆成这样:
```markdown
研究主题:工业设备预测性维护(PdM)在中小制造企业的落地情况
A. 市场边界(靠:行业报告、统计年鉴、协会白皮书)
- A1 什么算 PdM?和状态监测、EAM/CMMS 的边界在哪?
- A2 目标客户怎么定义"中小制造企业"?按营收、员工数还是设备台数?
- A3 市场规模的最新公开口径有哪些?彼此差异多大?
B. 竞争格局(靠:公司官网、招股书、年报、融资新闻)
- B1 主要玩家有哪几类(设备原厂、独立软件商、云厂商、系统集成商)?
- B2 每类玩家的典型打法、定价模式和交付方式?
- B3 近三年有哪些新进入者和退出者?
C. 客户与需求(靠:案例研究、招标公告、访谈、论坛)
- C1 中小制造企业采购的真实触发点是什么(停机损失?大客户审核?补贴?)
- C2 决策链条上有谁?谁出钱、谁用、谁反对?
- C3 常见的失败原因是什么?
D. 政策与技术(靠:政府文件、标准、专利、学术论文)
- D1 有哪些相关的产业政策、补贴和标准?(以官方发布页面为准)
- D2 技术路线上有哪些分歧(边缘侧 vs 云侧、机理模型 vs 数据驱动)?
E. 风险(靠:反面案例、财报风险提示、诉讼记录)
- E1 这个市场被证伪的证据有哪些?
- E2 哪些结论依赖单点信源、最不可靠?
```
D 和 E 这两块最容易被跳过,但汇报时被追问最多的恰恰是它们。
第二步:先定信源规则,再开跑
不要在跑完之后才抱怨"来源质量太差"。把规则写进提示词里,让它从一开始就带着约束跑。
一手来源(优先):公司官网与产品文档、招股书与年报、政府统计与政策原文、行业协会白皮书、国家标准与专利文件、招标公告、企业公开的财务披露。
二手来源(可用,需标注):券商研报、咨询公司公开摘要、有署名记者的权威媒体报道。
直接排除:没有署名和日期的聚合站、内容农场、明显由 AI 批量生成的 SEO 文章、以及任何"据业内人士透露"却不说明是谁的内容。
时间窗:主结论限定在近 3 年;超过 5 年的数据只能作为历史对照,且必须标注年份。
把这些写成一段可复用的"研究守则",塞进每一条提示词的开头:
```text
【研究守则】
1. 每一条事实性陈述后面必须给出编号引用,格式:[n] 来源名称 — 文档类型 — 发布时间 — 链接。
2. 找不到可靠来源时,直接写"未找到公开来源",不要用推测填充。
3. 区分三类信息并明确标注:一手来源数据 / 二手转述数据 / 你的推断。
4. 同一指标若有多个来源且口径不同,全部列出并说明差异,不要取平均。
5. 优先使用近 3 年的来源。使用更早的数据时必须标注年份和"历史数据"字样。
6. 不要引用无法打开的链接、论坛帖子和无署名内容。
7. 每条结论标注置信度:高(多个一手源交叉验证)/ 中(单一可靠来源)/ 低(推断或单点信源)。
```
第三步:写第一条研究指令
提示词的结构固定成五段:角色 → 任务 → 范围 → 输出格式 → 约束。模板如下:
```text
【角色】你是一名产业研究员,为投资决策做前期尽调。
【任务】调研"工业设备预测性维护(PdM)在中小制造企业的落地情况",
产出一份调研报告。
【范围】
- 地域:中国大陆为主,可对比欧美作为参照
- 时间:主结论限定近 3 年
- 必须覆盖:市场边界与规模口径、竞争格局分类、客户采购触发点、
政策与技术变量、已知的反面证据
【输出格式】
按以下结构输出,每个小节末尾附来源列表:
1. 摘要(不超过 300 字,只写有来源支撑的结论)
2. 市场边界与规模口径对比(表格:口径 / 数值 / 来源 / 年份)
3. 竞争格局(表格:玩家 / 类型 / 打法 / 交付方式 / 来源)
4. 客户与采购逻辑
5. 政策与技术变量
6. 反面证据与风险
7. 未解问题清单(你找不到答案的问题,逐条列出并说明"哪类文档可能回答它")
【约束】遵守下方研究守则,逐条执行。
(此处粘贴第二步的研究守则)
```
关键细节:要求它输出表格。表格会逼着它把"数值—来源—年份"对齐,比大段散文好核验得多。
第四步:分四轮跑,不要一次问完
第一轮:地图轮
用上面的完整提示词跑一遍。这一轮的目标不是拿到答案,而是拿到地图:知道这个领域有哪些玩家、哪些术语、哪些争议点。
跑完只做一件事:把输出里的新术语和没听说过的玩家名圈出来,它们是第二轮的关键词。
第二轮:深挖轮
针对第一轮的每个子问题,单独开一次任务。一次只问一个问题,深度会明显不一样。
```text
请专门调研:中小制造企业采购预测性维护方案的真实触发点是什么?
要求:
1. 尽量找一手材料——企业公开的案例研究、招标公告、财报中的相关表述、
行业媒体的深度访谈。
2. 至少找出 5 个具体案例,每个案例说明:企业规模、触发原因、
采购了什么、效果如何、来源链接。
3. 如果案例之间存在矛盾(有的说是因为停机损失,有的说是因为客户审核),
分别列出,不要强行统一。
4. 单独列出"你没能找到答案的问题"。
```
第三轮:反方轮
这一轮最容易被跳过,但价值最高。专门去找证伪证据:
```text
请扮演一个对这个市场持怀疑态度的分析师,尽最大努力反驳以下结论:
「中小制造企业对预测性维护的需求正在快速增长。」
要求:
1. 找反面证据:失败案例、项目烂尾、客户续费率低、伪需求论证、
行业整体的负面数据。
2. 找"增长"这个判断可能的统计陷阱(口径变化、幸存者偏差、样本偏差)。
3. 每条反驳都必须有来源,没有来源的反驳标注为"仅为逻辑推演"。
```
跑完这一轮,你会得到一份"如果被老板追问,我该怎么回答"的弹药。
第四轮:缺口轮
把前三轮所有的"未解问题清单"汇总,再跑一次:
```text
以下是我在前几轮调研中没能解决的问题清单:
(粘贴清单)
请逐一判断:
- 哪些问题其实有公开来源,只是之前的检索方式不对?给出线索。
- 哪些问题在公开渠道确实无解?
- 对确实无解的问题,建议我通过什么方式获得答案
(买哪类付费报告、访谈哪类角色、查哪类非公开数据库)?
```
这一轮的产出,通常比报告本身更能体现你的专业度。
第五步:把输出落成报告结构
四轮跑完,你手里是一堆碎片。用这个骨架拼起来:
```markdown
工业设备预测性维护在中小制造企业的落地情况调研
一、结论摘要
(每条结论后面挂引用编号,例如:中小客户的主要触发点是停机损失 [3][7]。)
二、市场边界与规模口径
(表格:口径 / 数值 / 来源 / 年份 / 备注)
> 注:不同机构口径差异较大,本报告不取平均值,仅并列呈现。
三、竞争格局
(分类:设备原厂 / 独立软件商 / 云厂商 / 系统集成商,逐类分析)
四、客户与采购逻辑
(含具体案例,每个案例标注来源)
五、政策与技术变量
六、反面证据与风险
(把第三轮的产出如实放进来,不要删)
七、未解问题与下一步
(把第四轮的产出放进来)
附录 A:引用清单
附录 B:事实核对表
附录 C:置信度说明
```
写正文时守两条铁律:
第一,事实和判断分开放。 事实段落末尾挂引用;判断段落开头写"我们认为……",并说明依据。混在一起是调研报告最常见的死法。
第二,没有引用的数字不写。 写不出来就写"该数据未找到公开来源"——审阅的人会觉得你靠谱,而不是觉得你没做完。
第六步:引用核验(最不能省的一步)
Deep Research 的引用会出错,这是常态,不是意外。常见三种错误:链接打不开、链接能打开但原文里没有这个数字、原文说的是 A 国而结论写成了全球。
核验方法很笨但有效——逐条点开。用下面这张表记录:
```markdown
| 编号 | 结论摘要 | 来源名称 | 类型 | 发布时间 | 链接可访问 | 原文是否支持该结论 | 处理 |
|---|---|---|---|---|---|---|---|
| 3 | 中小客户主因是停机损失 | 某公司案例研究 | 一手 | 20XX | 是 | 支持 | 保留 |
| 7 | 市场规模 XX 亿 | 某咨询摘要 | 二手 | 20XX | 是 | 原文是全球口径,结论写成了中国 | 改口径 |
| 12 | 政策补贴 XX | 未署名聚合站 | 三手 | 不明 | 是 | 无原始出处 | 删除 |
```
数量一多,可以用一段脚本先做粗筛。下面这段只做两件事:抽出所有引用链接、批量检查链接是否可访问。具体库的行为和站点反爬策略请以官方文档为准;很多网站会拦截自动请求,脚本报"失败"不等于链接失效,仍需人工确认;抓取前请遵守目标站点的 robots.txt 与使用条款,只做个人核验用途。
```python
check_citations.py
用途:从报告 Markdown 中抽出引用链接,批量做可达性粗筛
注意:仅作辅助,最终必须人工点开核对,脚本无法判断"原文是否支持结论"
import re
import time
import requests # 以官方文档为准,版本差异不大
REPORT_FILE = "report.md"
TIMEOUT = 10
部分站点会拒绝脚本请求,可在此处换成浏览器 UA
HEADERS = {"User-Agent": "Mozilla/5.0 (compatible; CitationCheck/1.0)"}
def extract_urls(text: str) -> list[str]:
"""抽出 Markdown 里的 http(s) 链接,去重保序"""
pattern = r"https?://[^\s\)\]\>\"',。;]+"
seen, urls = set(), []
for u in re.findall(pattern, text):
if u not in seen:
seen.add(u)
urls.append(u)
return urls
def check(url: str) -> str:
"""返回简单状态,不做内容判断"""
try:
优先 HEAD,失败再退回 GET
resp = requests.head(url, headers=HEADERS, timeout=TIMEOUT, allow_redirects=True)
if resp.status_code >= 400:
resp = requests.get(url, headers=HEADERS, timeout=TIMEOUT, allow_redirects=True)
return f"{resp.status_code}"
except Exception as exc: # 网络错误、超时、被拦截都会走到这里
return f"ERROR: {type(exc).__name__}"
def main() -> None:
with open(REPORT_FILE, encoding="utf-8") as f:
text = f.read()
urls = extract_urls(text)
print(f"共发现 {len(urls)} 条链接\n")
for i, url in enumerate(urls, 1):
status = check(url)
print(f"[{i:03d}] {status:<12} {url}")
time.sleep(1) # 放慢速度,避免给对方站点造成压力
if __name__ == "__main__":
main()
```
核验之后,把结果分成三类处理:
- 可保留:原文确实支持结论 → 保留编号。
- 需改写:原文支持一个相近但不完全一样的结论 → 修改正文表述,让它和原文一致。
- 必须删:找不到原始出处、链接失效、来源不可靠 → 整条删掉。宁可少一条,不要留一条假的。
第七步:让工具反过来审你的稿子
最后一步,把成稿贴回去,让它当审稿人:
```text
以下是我完成的调研报告。请以严格的审稿人身份检查:
1. 逐条列出「没有引用支撑的事实性陈述」。
2. 逐条列出「引用与结论不匹配」的地方(引用说的和结论说的不是一回事)。
3. 指出哪些结论实际上依赖同一个来源,却被写得像是多个来源互相印证。
4. 指出哪些地方把推断写成了事实。
5. 不要重写报告,只输出问题清单,按严重程度排序。
```
这份清单通常能揪出 5–15 个问题,修完再交。
常见坑与排错
| 症状 | 原因 | 处理 |
|---|---|---|
| 引用链接点开是 404 | 模型拼凑出的链接,或原文已下线 | 直接删掉该条结论,不要试图"换个链接凑上" |
| 同一指标两个来源差好几倍 | 口径不同(全球 vs 中国、含服务 vs 纯软件) | 并列呈现,注明口径,绝不取平均 |
| 全篇都是 2018、2019 年的数据 | 提示词没设时间窗,检索优先命中了老报告 | 在研究守则里写死"近 3 年",并要求标注年份 |
| 报告读起来很流畅但没有信息量 | 提示词太宽,模型只能输出通用套话 | 把子问题拆细,一次只问一个 |
| 只看到正面结论,一问就被问倒 | 没跑反方轮 | 补跑第三轮,专门找证伪证据 |
| 国内信息覆盖明显不足 | 检索偏向英文源 | 在提示词里明确"中文来源优先",并单独跑一轮中文检索 |
| 大段营销话术被当成事实 | 把厂商官网的宣传语当成了市场数据 | 厂商自述只能作为"厂商主张",不能作为市场规模来源 |
| 跑一次就交稿 | 混淆了"生成"和"调研" | 至少跑完四轮,缺口轮不能省 |
还有两个隐蔽的坑值得单独说:
"多源印证"的假象。 三个不同网站写了同一个数字,很可能它们都抄自同一份原始报告。核验时要往上追一层,找到最初的出处。如果追不到,就标注"该数据广泛流传但未找到原始出处"。
时间戳陷阱。 一篇页面显示"最近更新"是今年,但里面的数据是五年前的。核验时看的是数据本身的年份,不是页面的更新日期。
下一步建议
第一,把流程模板化。 把第二步的研究守则、第三步的提示词模板、第五步的报告骨架存成一份可复用的文档。下次换主题,只改「研究主题」和「问题树」两处,其余照搬。这是这套方法最大的杠杆。
第二,把核验表格变成资产。 每次调研的引用清单和事实核对表攒下来,半年后做同一领域的新报告时,你会有一份别人没有的历史基线。
第三,建立定期刷新机制。 行业报告是有保质期的。对关键指标设一个复查周期(比如每季度),到期重跑第一轮和第三轮,看结论有没有被推翻。
第四,明确它的能力边界。 Deep Research 擅长的是"把散落在公开渠道的信息整理成结构",不擅长的是"判断一家公司的销售能力到底行不行""某个客户的预算明年会不会砍"。这些必须靠访谈和实地验证。把 AI 的产出当作尽调的起点而不是终点——它帮你把该问的问题列全了,剩下的电话还得你自己打。
第五,向上游走。 当你跑顺了这套流程,可以尝试更难的任务:让 Deep Research 先输出一份"调研方案"(该查什么、该问谁、该看哪类文档),你审核后再执行。从"用它写报告"变成"用它设计调研",价值会再上一个台阶。
