用批判性思维梳理复杂问题
cc-thinking-skills
为 Claude Code 提供 39 种心理模型和批判性思维框架,助力 AI 代理进行结构化推理、决策分析与风险评估。

试试这样做
详细介绍
Claude Code Thinking Skills
Claude Code 的 28 种思维模型与批判性思维框架
Claude Code Thinking Skills 是一个包含 28 种思维模型和批判性思维框架的集合,专为 Claude Code 设计。它为 Anthropic 的 AI 编程助手提供了结构化的推理方式,用于决策、调试、系统分析、风险管理和策略规划。每个技能都封装了一个经过验证的思维框架——从第一性原理推理到约束理论——你可以通过名称调用。整个集合基于一个透明、可复现的评估管道。

概览
| 是什么 | 一个包含 28 种思维模型和批判性思维技能的库,用于 Claude Code。 |
| 适用人群 | 希望 Claude Code 使用结构化框架而非临时启发式方法进行推理的工程师、创始人和分析师。 |
| 如何开始 | 通过插件市场安装,然后调用 thinking-model-router 来路由到合适的技能。 |
| 证据 | 每个技能都经过可复现的 Elevate-or-Kill 评估管道 测试。诚实的结论是:目前没有任何技能拥有稳健、可复现的 ELEVATE 判定——我们公开了这一结果,而不是隐藏它。 |
| 入口 | thinking-model-router → 从这里开始 |
为什么这个项目与众不同
大多数“AI 提示包”仓库声称其内容能让模型更聪明,但从未验证。这个项目反其道而行之:它构建了一个客观、长度可控、可复现的评估工具,并评估了包含 39 个技能的旧版目录。结果被公开记录,包括一个令人不适的发现:没有任何技能达到可证明、可复现的准确率提升标准。
严谨是关键。这些技能是基于成熟框架的有用结构化推理支架,评估方法足够诚实,能告诉你证据有多强。透明而不是炒作,是这里的标准。
功能特点
- 28 种思维框架 — 精选的思维模型库,用于决策、调试和策略。
- 经过评估且诚实 — 通过严格的、可复现的评估管道构建和测试;参见 Elevate-or-Kill 记分卡。
- 经过实战检验的基础 — 基于认知科学、系统思维和战略分析中的框架(芒格、梅多斯、卡尼曼、高德拉特、阿奇舒勒/TRIZ、博伊德/OODA)。
- 原生 Claude Code — 专门为 Claude Code 的技能系统和调用模型设计。
- 零配置 — 安装后直接通过名称调用技能,无需设置。
可用技能
所有 28 个已发布的技能,按领域分组。元技能 thinking-model-router 是推荐的入口点。
决策与分析
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-first-principles |
将问题分解为基本事实 | 创新、挑战假设 |
thinking-second-order |
思考超越直接后果的影响 | 战略决策、政策变更 |
thinking-pre-mortem |
想象失败并逆向推导 | 项目启动、风险评估 |
thinking-kepner-tregoe |
用于复杂分析的系统化理性过程 | 高风险决策、根本原因分析 |
thinking-reversibility |
按可逆性分类决策(类型 1/2) | 承诺规模、风险评估 |
thinking-opportunity-cost |
评估选择时考虑放弃的东西 | 资源分配、优先级排序 |
认知与行为
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-bounded-rationality |
在约束下做出足够好的决策 | 时间压力、满意化 |
thinking-socratic |
系统化提问框架 | 需求分析、调试、辅导 |
thinking-probabilistic |
校准的概率估计 | 预测、不确定性量化 |
thinking-steel-manning |
论证最强的对立立场 | 辩论、决策验证 |
系统与策略
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-systems |
分析相互关联的系统 | 复杂调试、架构设计 |
thinking-ooda |
动态情境下的快速决策 | 事件响应、竞争场景 |
thinking-theory-of-constraints |
识别并管理瓶颈 | 性能优化、吞吐量 |
thinking-cynefin |
按复杂性领域分类问题 | 方法论选择、方法匹配 |
问题解决与创新
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-map-territory |
识别思维模型的局限性 | 期望 mismatch、抽象 |
thinking-circle-of-competence |
了解专业知识的边界 | 委派、学习决策 |
thinking-triz |
解决技术矛盾 | 工程设计、创新 |
thinking-five-whys-plus |
带偏差防护的增强型根本原因分析 | 调试、事件事后分析 |
thinking-scientific-method |
假设差分调试 | 故障定位、模糊症状 |
thinking-thought-experiment |
结构化想象以探索 | 架构、边界情况、哲学 |
估算与风险
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-margin-of-safety |
为不确定性建立缓冲 | 风险管理、系统设计 |
thinking-lindy-effect |
存在时间越长,未来可能持续更久 | 技术选择、持久性 |
thinking-via-negativa |
通过移除而非增加来改进 | 简化、健壮性 |
thinking-red-team |
对抗性地攻击自己的计划 | 安全审查、计划验证 |
产品与创新
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-jobs-to-be-done |
理解客户雇佣产品完成的工作 | 产品开发、功能设计 |
thinking-effectuation |
从手段而非目标出发 | 创业、创新、不确定性 |
元技能
| 技能 | 描述 | 最佳适用场景 |
|---|---|---|
thinking-model-router |
从这里开始 - 按领域路由到合适的模型 | 所有思维技能的入口点 |
thinking-model-combination |
组合多个模型进行更丰富的分析 | 复杂问题、高风险决策 |
技能评估方式
对证据的诚实是这个项目的核心特征,因此评估结果被如实报告。
- 证据基础: 历史覆盖范围不均匀且仍是暂定的。修正后的
portfolio-v1关卡没有进行任何模型调用,因为功率、数据集和评判校准要求未满足。 - 主要结论: 目前没有任何技能拥有稳健、可复现的 ELEVATE 判定。 所有 28 个已发布的技能都是仅手动调用的;没有证据证明它们能提高模型准确率。
- 最接近的历史候选:
thinking-scientific-method在其较大样本量的七月工件中记录了临时的 +4.0pp 故障定位提升。尽管其重新计算的 McNemar 结果显著,但效果低于预先声明的 +5pp 效用阈值,并且该研究存在评分、对照组、分母和原始存档缺陷。它只是方向性证据,而非 ELEVATE。 - 这对你意味着什么: 将这些技能视为结构化推理支架,而不是保证准确率提升的工具。审计保留了有用的框架,同时将未经支持的性能声明排除在产品之外。
亲自阅读证据:
已发布的目录现在包含 28 个技能。在证据支持的切换中,移除了 11 个无支持或重叠的技能;其独特机制被吸收到保留的技能中,历史证据得以保留。
使用方法
安装后,在 Claude Code 中通过名称调用任何技能。如果你不确定哪个框架适合,从 thinking-model-router 开始:
> 使用 thinking-model-router 为这个问题选择合适的框架
> 使用第一性原理思维分析这个架构决策
> 对这个项目计划应用事前验尸框架
> 帮我使用概率推理评估这个假设
> 使用约束理论找到我们的瓶颈
详细技能描述
第一性原理思维
剥离假设,揭示基本事实,然后从基础重新构建解决方案。由埃隆·马斯克倡导,根植于亚里士多德哲学。
何时使用:
- 常规方法已失败
- 被告知某事“不可能”
- 需要创新,而非渐进式改进
概率推理
估计不确定性,用证据更新先验,暴露假设和校准。
何时使用:
- 估计概率或可能性
- 解释测试结果或指标
- 在信息不完整的情况下做决策
系统思维
将问题视为相互关联的整体的一部分,具有反馈回路和涌现特性。对于调试复杂分布式系统至关重要。
何时使用:
- 调试涉及多个组件
- 在一个地方修复导致另一个地方出错
- 行为似乎是涌现的或意外的
约束理论
每个系统恰好有一个约束限制吞吐量。优化其他任何东西都是浪费精力。基于 Eliyahu Goldratt 的工作。
何时使用:
- 性能优化
- 流程改进
- 资源分配
- 识别瓶颈
科学方法 / 假设差分调试
通过枚举可证伪的假设,按其可能性 × 检查成本排序,并首先进行最便宜的区分性观察,来定位模糊的 bug。这是集合中经过最严格实证检验的技能(最终判定:DIRECTIONAL-NOT-REPLICATED——参见评估结果)。
何时使用:
- 一个症状可能来自多个文件/函数/组件
- 你现在可以检查代码、日志、差异、跟踪或测试
- 在应用根本原因分析之前需要定位故障
Cynefin 框架
根据因果关系对问题进行分类:清晰、复杂、复合、混乱。每个领域需要不同的方法。
何时使用:
- 选择方法论
- 理解方法失败的原因
- 危机管理
待完成的工作
客户不购买产品——他们雇佣产品来完成工作。理解工作能解锁创新。
何时使用:
- 产品开发
- 功能优先级排序
- 理解客户行为
红队思维
在对手之前攻击自己的计划。最好的防御是知道自己的弱点。
何时使用:
- 安全审查
- 发布前准备
- 计划压力测试
常见问题
什么是 Claude Code 思维技能?
Claude Code 思维技能是 28 种可重用的思维模型和批判性思维框架,打包为 Claude Code 技能。每个技能为 AI 代理提供一种结构化方法——例如第一性原理推理、概率更新或约束理论——用于分析特定类型的问题。你可以通过名称调用它们,以指导 Claude 在决策、调试和策略中的思考方式。
我应该从哪个思维技能开始?
从 thinking-model-router 开始。它是一个元技能入口点,读取你的问题并路由到最相关的框架,因此你不需要记住所有 28 个。如果你已经知道自己的需求——例如调试、风险或优先级排序——可以直接调用特定技能。
这些技能真的能提高 Claude 的准确率吗?
目前没有任何技能被证明能提高准确率。每个技能都经过可复现的评估,零技能拥有稳健、可复现的 ELEVATE 判定。 最接近的候选是 thinking-scientific-method,在其新鲜的首次运行中获得了 +5.3pp(p=0.061,n=150)——方向性但未达到 p<0.05 门槛——且具有显著的 +8.0pp(p=0.001)的可复现性;因为显著的可复现性不能挽回失败的门槛,其判定为 DIRECTIONAL-NOT-REPLICATED。将这些技能视为可靠的结构化推理支架,而不是保证的准确率提升。
模型路由器技能是什么?
thinking-model-router 是一个元技能,充当集合的入口。给定一个问题描述,它识别领域(决策、系统、估计、调试等)并指向最合适的思维框架。它的存在是为了让新手无需研究整个目录就能获得价值。
这些技能基于真实研究吗?
是的。这些框架借鉴了查理·芒格(思维模型)、多内拉·梅多斯(系统思维)、丹尼尔·卡尼曼(双过程认知)、埃利亚胡·高德拉特(约束理论)、根里奇·阿奇舒勒(TRIZ)和约翰·博伊德(OODA 循环)等思想家的成熟工作。除了源理论,这些技能还经过了本项目自己的长度可控、可复现的评估管道,所有结果都发布在 Elevate-or-Kill 记分卡 中。
这些技能免费使用吗?
是的。整个集合根据 MIT 许可证发布,你可以自由使用、修改和分发。
注意事项
- 这些技能是结构化推理支架,不是保证准确率提升的工具。
- 目前没有任何技能被证明能提高模型准确率。所有技能都经过评估,但均未达到稳健、可复现的 ELEVATE 判定。
- 使用前需要通过插件市场安装技能。安装后,通过名称在 Claude Code 中调用。
- 评估结果公开可用,包括审计和证据注册库。