美国国家科学院院士、清华大学兴华卓越讲席教授、pp体育
主任 刘军应中国化工学会及科普中国邀请,围绕“统计学与人工智能”展开直播漫谈。相关内容在人民日报、光明网、央视频、中国青年报客户端等多个平台上线。 这场分享从个人选择、统计直觉和AI浪潮讲起,希望以更通俗的方式做社会科普,让更多人理解:AI越热,统计为什么反而越重要。
内容概述
刘军院士首先回顾了自己的学业选择,统计吸引他的地方在于:它直面不确定性,与很多学科交叉,而且当时还不够系统完善,有改进空间。导师们从第一性原则思考、敢于进入陌生领域,也影响他后来进入生物信息、遗传统计等方向。他特别提到,选专业不必只盯热门,兴趣往往更能支撑一个人走远。
他认为统计是收集数据、分析数据、用数据得出结论的方法论。高质量数据对统计和AI训练都至关重要。
刘军院士还提到Google流感趋势的失败:它把冬季、赛事等混杂因素误当流感信号,去除季节性和混杂后准确率才提高。这些例子都指向同一件事:数据不会自己发声,统计思维能帮我们看清数据背后的偏差和不确定性,也能帮助我们理解AI幻觉,很多问题其实出在数据和训练方式上。
在刘军院士看来,统计和AI的关系可以用两句话概括: 统计是“从数据走向智慧”,AI则更像“从智慧走向数据” 。AI以统计方法为引擎,以数据为燃料。机器学习可追溯到高斯线性回归,后来发展到深度网络、生成式模型、扩散模型、Embedding、Transformer和强化学习。Embedding把词语、图像、语义映射到向量空间,Transformer增强上下文关联,强化学习通过与环境交互、奖励惩罚来学习策略。扩散模型则先一步步加噪,再反向去噪生成图像,底层涉及随机微分方程、概率和统计。也就是说,想真正理解AI,数学、概率和统计是绕不开的底层语言。
最后,他谈到AI如何落地。大模型直接用到医疗、生命科学、材料设计、数字人文、地球环境、数字治理等领域,往往就差“最后一公里”的精度。这一步需要统计模型把专业知识、数据关联和不确定性量化连接起来。因此他说,统计数据科学是AI落地的关键钥匙。未来要以统计思维为基础、交叉创新为路径、方法自信为动力,发展和定义新的人工智能。
刘军院士也介绍了 清华大学应用统计专业学位硕士项目(非全日制) ,目标是以实践为导向,培养有核心竞争力的数据科学人才。

点击图片观看完整视频