用人类是否能分辨机器来判断机器智能表现的测试。
图灵测试像 AI 的“能不能装成人类”面试,重点不是它有没有灵魂,而是你会不会被骗过。
它曾是智能讨论的经典入口,但今天的模型会聊天,不代表真的会理解一切。
LLMLLM 提升了机器在自然语言对话中的拟人表现。
AGITuring-test 常被用来讨论 AGI 是否具备可观察能力。
Reasoning-modelReasoning-model 强化了机器在复杂问答中的推理表现。