郝思蒙引路人系列 · 公开断言核查

附录

质检报告

✅ 全部硬门通过

逐字 / 出处

引文 137 · 逐字✗ 0 · 出处✗ 0 · 未标出处 70 · 汉字 11,594 · 不是…而是 3

内容安全门

G3 语料完整 ✓ 通过
G4 敏感内容 ✓ 通过
G5 心理归因 ✓ 通过
G6 总分禁令 ✓ 通过
G7 隐私 ✓ 通过

生产流程记录

本页公开这份核查的校验过程与失败记录,不只公开结论。所有硬门由 qa/run_qa.py 确定性执行,可复跑。

先说最重要的一件事:第一版被撤下了

2026-09-23,本项目的第一版产出(一份预测对账表 + 三篇人物画像,共 12 万字符)经跨厂商独立审计判定为「不建议公开」,必须修 11 条。它没有上线超过一小时,已整体撤下归档,不会以任何形式发布。

第一版的错误不是错字,是方法:

错误 说明
用月 K 推月内顺序 价格表是周 K 聚合的月度高/低/收。它无法确定月内哪天出现低点。第一版据此推出「他发文时价格约 $73,000」「低点在其发文之后」,进而判定其操作失败——这三步都没有数据支撑
分类混淆 把「未到期」「源文缺失」「口径不明」一并塞进「结构上不可证伪」。源文缺失是我们查不到,不是他设计了不可证伪装置
事后全知视角 用回头才知道的周期峰值,评价当事人实时做的决定
把自述扩写为事实 语料是粉丝编集的网络作品,可能包含修辞、人设、科幻表达与编辑加工。第一版跳过这一层,直接从第一人称写作走到「他真实的内心」
自己犯了所批评的毛病 一边批评他用小数点制造权威,一边用 53.3%、43.6%、84%、95% 置信区间制造同一种权威。这些数字来自我们自己划的口径

审计还做了一件我们请它做的事:用虚构样本攻击第一版的质检门——六门全绿,退出码 0。那道门只证明了字符串出现过。

现在这一版是从原始语料重写的,不是在第一版上打补丁。

这一版明确不做什么

写在报告正文第一节,也写在这里:

  1. 不做任何心理、动机、性格推断
  2. 不涉及健康、用药、家庭成员、已故亲属、暴力经历、婚恋内容
  3. 不给总分、命中率、胜率、置信区间——不提供任何可被当成结论的单一数字
  4. 不评价其交易操作(他从未公布成交价、数量、仓位、日期)
  5. 不用月度行情推断月内顺序
  6. 不判定「他真的赚到了钱」,也不背书任何未经核实的好话
  7. 不把「语料里没出现过 X」写成「他从不 X」

八道硬门

检什么
G1 引文逐字 声称出自语料的引文(后随《文章名》或 weibo_ 标记)必须逐字可查
G2 出处一致 这类引文必须出自它所标的那一篇
G3 语料完整 语料正文必须与完整版等长 —— 防止再次使用截断语料
G4 敏感内容 健康 / 用药 / 亲属 / 暴力 / 婚恋词表:零容忍
G5 心理归因 潜意识 / 防御机制 / 内心深处 等:零容忍
G6 总分禁令 命中率 / 胜率 / 置信区间:只允许出现在否定声明或引文中
G7 隐私 本地路径、邮箱、第三方微信号、微博 uid、钱包地址
G8 完整性 报告必须存在、非空、引文数 > 0(防空文件假绿)

G3 是审计直接催生的:第一版质检用的语料有三处截断pdf_038pdf_055pdf_081),其中《问答集》只收了 27 组问答,完整版有 148 组、4.2 万字,而且含提问者发言。第一版的文体统计因此混入了别人的话。现已恢复完整版并逐行标注 [self] / [asker],作者统计只取 [self]

这道门不能证明什么

诚实地说清楚,否则它就成了第二个「六门全绿」:

  • 它证明引文出现在语料里,不证明语料本身可靠。语料是粉丝编集的网络作品,原始发布时间多数没有证据。
  • 归一化比对会抹掉标点。所以「逐字」指的是字形序列,不含标点。
  • 外部权威来源的引用(央行、统计局、美联储、证监会公告)不进 G1/G2,只计数并打印,由人复核。
  • 它完全不检查推论是否成立。一条引文真实、出处正确、数字对得上,不代表由它得出的结论正确。
  • 词表门是字符串匹配,规避它很容易。它防的是疏忽,不是防恶意。

已知局限

  1. 日期是最大的不确定性。 89 篇里只有 13 篇标为 explicit,而 explicit 也不等于原始发布时间——pdf_029 标题是「2024 年 1 月 1 日家庭欧洲聚会」,正文却说「即将到来的 2024 年」,聚会日期不是发文日期。报告按「原始发布证据 / 活动日期 / 标题年份 / 内文推断」分开标注,没有原始发布证据的,不用于证明预测具有前瞻性
  2. 语料有一处日期被行情表证伪:《突破 19000(2022.12)》标注 2022 年 12 月,但该月区间 16,256–18,388,全月未触及 19,000。这是编者或原文的日期问题,不是作者伪造战绩
  3. 月度分辨率:所有价格结论只写「截至基准日已观测」,周期划分是本文的审计定义,不是当事人当时能知道的。
  4. 选择偏差:文集由粉丝编选,取舍本身构成一层筛选,本文无法校正。

本次运行结果

构建时由 qa/qa-result.json 自动填入,见下方表格。失败数会如实显示,不是只在全绿时才显示。