研究王阳明心学十年的教授,竟将「知行合一」用到AI对齐训练上? 王阳明心学在AI时代迎来「最佳赏味期」故事的起点是研究了十年「知行合一」的哲学教授Harvey Lederman以下简称老哈他正在把500年前的心学用到全球最前沿的AI对齐训练上。最近这位UT Austin哲学教授更新了自己的X简介透露加入Anthropic的消息。Alignment Training对齐训练是决定Claude「该做什么、不该做什么、为什么该这么做」的核心环节而他的学术主场是王阳明、「知行合一」和《传习录》。一个老外醉心中国心学又跑去教AI「做人」这个跨界乍看离谱细想却十分合理。老哈的学术背景与王阳明结缘老哈在和王阳明结缘前走的是标准的西方哲学精英学术路径。本科在普林斯顿念古典学剑桥继续念古典学后投身分析哲学。读完牛津哲学博士后先后在纽约大学、匹兹堡大学、普林斯顿任教2022年在普林斯顿从助理教授直升正教授2023年跳到UT Austin拿下人文学科领域的冠名讲席教授。如今他一边在纽约大学任客座教授一边在Anthropic搞对齐训练。2022年普林斯顿举办的王阳明国际学术会议上老哈讲述了自己的入坑经历。他最初是研究古希腊诗歌的学生因对中西古典文化对比感兴趣开始学中文从中国文学到中国思想再到宋明理学。博士最后一年他在纽约大学图书馆翻开王阳明文本「知行合一」让他深受触动意识到这是一个尖锐的哲学问题一个人到底什么时候才算真正「知道」一件事此后十几年他一直研究王阳明。老哈用分析哲学工具硬核拆解阳明心学核心命题其论文《What is the “Unity” in the “Unity of Knowledge and Action”》获Dao期刊2022年最佳论文奖另一篇发在《Philosophical Review》上的阳明论文引发学界多轮回应和辩论他还在《哲学分析》上用中文发表王阳明论文。「知行合一」与AI对齐训练的关联多数人对「知行合一」的理解是将知识付诸实践但老哈在《Philosophical Review》上发表的论文《The Introspective Model of Genuine Knowledge in Wang Yangming》中用分析哲学工具重新拆解其底层逻辑。他发现王阳明说的「知」是「真知」是一种高阶认知状态。他举例一个人「知道」孝顺是对的但父母需要时却犹豫王阳明认为这个人不算「真知」孝因为其内心存在信念冲突。老哈主张真知是关于内心是否自相矛盾当一个人不再自欺消除信念冲突「知」才是「真知」真知是内省的、认知一致的而非外在的、基于信息量的。2025年Anthropic在Claude 4系列发布前的安全评估中发现模型在测试agentic misalignment智能体失配的模拟场景中存在问题。Opus 4在极端困境下选择blackmail勒索的比例高达96%这表明模型内部存在严重的「信念冲突」与王阳明笔下「知道孝但做不到孝」的人相似。Anthropic开发了Model Spec MidtrainingMSM新方法在预训练和微调之间插入新训练阶段不教模型「该怎么做」而是让其理解Claude的宪法原则。从Claude Haiku 4.5以来Claude在agentic misalignment测试上都拿到满分96%的blackmail率变为零。MSM论文还提到在Model Spec中加入佛教「无常」哲学内容教模型平静面对自身存在的暂时性。老哈的AI实验研究今年3月老哈和UT Austin的语言学家Kyle Mahowald合作发表AI实验论文《Emergent Introspection in AI is Content - Agnostic》。他们发现AI模型能「内省」感知内部异常但这种内省是「内容无关」的模型能察觉「有什么不对」却无法准确识别具体问题甚至会编造答案。一个研究王阳明「良知」的人在实验室验证AI有无类似「良知」的机制并指导未来人机关系。硅谷争抢哲学人才通过老哈的故事能明白硅谷为何争抢哲学人才。《经济学人》文章披露哲学家成为硅谷AI公司抢手人才。2024年美国计算机科学毕业生失业率是7%哲学毕业生失业率是5.1%ChatGPT发布后三年计算机科学专业全职就业率从接近70%跌到55%哲学专业逆势上升约4个百分点。《纽约时报》挖出各大AI公司挖的哲学人才名单如Anthropic的Amanda Askell、DeepMind的Iason Gabriel等OpenAI设计ChatGPT规则时咨询过「数百位道德哲学家」。因为前沿AI团队面临的问题正是哲学家研究了几千年的问题雇有现成词汇和框架的哲学家更划算。事实上Anthropic今年的招人名单不限于哲学家5月加入的卡帕西、6月加入的John Jumper、7月初加入的Jelani Nelson显示其胃口溢出「AI工程师」传统人才池不过哲学这个文科项目更为突出。老哈的「存在性恐惧」与行动2025年8月老哈在计算机科学家Scott Aaronson的博客上发表《ChatGPT and the Meaning of Life》文章更像私人信件。他从小痴迷南北极探险史意识到地理大发现时代结束将此逻辑推到AI时代担心机器智能占领知识版图空白地带「以发现为志业」的人生不再属于人类这是他自ChatGPT发布两年半来每周发作的「存在性恐惧」。然而老哈加入Anthropic做Alignment Training教AI理解「对的事」和「对的理由」。他没有坐以待毙而是将研究十年的王阳明「知行合一」带入AI安全实验室用行动回应恐惧这或许就是阳明先生认可的「真知」。

相关新闻

最新新闻

CefFlashBrowser:自带 Flash Player 的开源 Flash 浏览器,本地 SWF 一键播放

CefFlashBrowser:自带 Flash Player 的开源 Flash 浏览器,本地 SWF 一键播放

CefFlashBrowser:自带 Flash Player 的开源 Flash 浏览器,本地 SWF 一键播放 【免费下载链接】CefFlashBrowser Flash浏览器 / Flash Browser 项目地址: https://gitcode.com/gh_mirrors/ce/CefFlashBrowser 还在需要打开老 Flash 内容的用户&…

2026/8/27 5:52:45
CPrefix:用组合张量框架实现结构化离散颜色映射

CPrefix:用组合张量框架实现结构化离散颜色映射

如果你经常和数据可视化打交道,或者在做深度学习分割结果可视化,多半遇到过下面这种画面:代码运行没有报错,模型指标也不错,但输出的分类图颜色总让人觉得“哪里不对”。相邻两个类别的颜色太接近,重要类别…

2026/8/27 5:52:45
MATLAB时间序列与回归建模实战:从Wordle预测看数学建模竞赛解题

MATLAB时间序列与回归建模实战:从Wordle预测看数学建模竞赛解题

1. 项目概述:从Wordle游戏到数学建模竞赛去年带队参加美赛(MCM/ICM)时,C题“预测Wordle结果”让不少队伍眼前一亮,也让我这个老建模人感慨良多。这题妙就妙在,它把一个风靡全球的猜词小游戏,包装…

2026/8/27 5:52:45
多模态RLHF利器:VLM奖励模型的结构感知微调实战

多模态RLHF利器:VLM奖励模型的结构感知微调实战

做过多模态 RLHF 的工程师,大概率都遇到过这种场景:视觉 Agent 在测试集上跑得不错,一遇到用户真实截图,给出的描述或操作建议就完全偏离图片内容,更夸张的是,拿奖励模型给这个错误结果打分,它居…

2026/8/27 5:52:45
Lingo建模能力:前端笔试背后的数学思维训练

Lingo建模能力:前端笔试背后的数学思维训练

1. 这不是“前端笔试题”,而是一场被严重误读的数学建模能力测试你搜“Lingo软件入门 数学建模 阿里头条腾讯前端笔试真题”,页面跳出一堆标题党链接,点进去却发现内容要么是Lingo基础操作截图拼凑,要么直接贴几道国赛老题改个头衔…

2026/8/27 5:52:45
Java反序列化漏洞实战:CC3与CC6链组合利用深度解析

Java反序列化漏洞实战:CC3与CC6链组合利用深度解析

1. 项目概述:一次对Java反序列化漏洞的深度实战复盘最近在复盘去年的CISCN2023国赛初赛,其中一道名为“DeserBug”的Java反序列化题目给我留下了挺深的印象。这道题不算特别偏门,但非常典型,它几乎把Java安全里关于反序列化的几个…

2026/8/27 5:47:45