GPT-5.6 Sol 90 分钟证伪 20 年统计学猜想:BH 程序并非万无一失

## GPT-5.6 Sol 90 分钟证伪 20 年统计学猜想
宾夕法尼亚大学沃顿商学院副教授 Edgar Dobriban 用 GPT-5.6 Sol Pro,证伪了一个在多重假设检验领域站立约 20 年的猜想,并将结果作为 arXiv 预印本发布,自己列为唯一作者。
**要点**
- **被证伪的是什么**:Benjamini-Hochberg(BH)程序是控制错误发现率(FDR)的奠基性方法,1995 年的原始论文被引超 13 万次。猜想认为 BH 对「相关的双侧高斯检验」在任何相关结构下都能控制 FDR——AI 证明并非如此。
- **90 分钟 vs 20 小时**:模型单次尝试约 90 分钟就给出完整反例、证明和机器可检查的数值证书;而 Dobriban 透露,GPT-5.5 即使用多智能体并行迭代 20 多小时也没解出来,直观展示了代际差距。
- **学术规范**:Dobriban 在预印本中明确说明证明由 GPT-5.6 Pro 获得,署名自己为唯一作者——「AI 出证明、人类担责」的新范式的新范式正在形成。
> 原文链接:[点击查看原文](https://mlq.ai/news/openais-gpt-56-sol-disproves-20-year-old-statistics-conjecture-in-90-minutes/),正文为摘要整理,仅供参考。



