LLMs为何仍不具备真正推理能力:AlphaGo架构带来的启示
Thore Graepel认为,当前 LLM 的链式推理仍是反复预测下一个 token,缺少独立、持久且可检查的认知状态。文章以 AlphaGo 的 policy network 和搜索机制为参照,主张让通用 AI 通过维护 epistemic state、调用工具并依据证据更新判断来开展推理。
Thore Graepel认为,当前 LLM 的链式推理仍是反复预测下一个 token,缺少独立、持久且可检查的认知状态。文章以 AlphaGo 的 policy network 和搜索机制为参照,主张让通用 AI 通过维护 epistemic state、调用工具并依据证据更新判断来开展推理。