理查德·欧内斯特·贝尔曼(Richard Ernest Bellman)于1920年8月26日出生于纽约市。他曾就读于布鲁克林的亚伯拉罕·林肯高中,并在高年级时成为全市数学竞赛的优胜者。1941年,他在约翰·霍普金斯大学获得学士学位,并在威斯康星大学取得数学硕士,同时在电子学方面颇有造诣。二战期间,他在美国陆军训练计划中教授数学,后赴洛斯阿拉莫斯参与原子弹理论研究。
1946年贝尔曼回到普林斯顿大学,在所罗门·莱夫谢茨(Solomon Lefschetz)教授指导下完成博士学位,研究非线性微分方程的稳定性,并任教至1948年。同年夏,他加入兰德公司,成为运筹分析部门的骨干,专注于多阶段决策问题研究。在兰德公司,他的研究和成果奠定了“动态规划”的基础——这一术语就是由他亲自命名的,用来描述多阶段决策问题中涉及的函数方程与优化。他在1952年发表的首篇关于动态规划的论文刊登在《美国国家科学院院刊》,1953年又发表了一篇更全面的论文,并扩展为1957年的专著《动态规划》。1954年,他开始涉足随机过程和马尔可夫决策过程的建模;1957年,他在《数学与力学杂志》发表论文,引入了“状态空间迭代”方法。随后,他提出了著名的“贝尔曼方程”,成为随机控制和最优化领域的基石。
1965年起,他转至南加州大学任教授,跨足数学、电气工程和医学三大领域。1973年因脑瘤手术并发症几近全身瘫痪,但他依旧保持敏锐的思维和高产的研究热情,此后仍发表近百篇论文。他对人工智能数学方法十分关注,虽未能亲眼见证动态规划在20世纪80年代成为机器学习的重要范式,但其思想深刻影响了强化学习、神经动态规划等诸多方向。
贝尔曼始终强调数学应服务于人类社会,一生共发表619篇论文和39部专著,大多与动态规划密切相关。他以卓越的洞察力和创造力推动了人类对自然与人工系统的理解与控制,留下了深远的学术遗产。