(通讯员:丁真真)2026年7月17日下午14:00,康涅狄格大学王海鹰副教授莅临长春工业大学数学与统计学院,针对海量数据子抽样中的两类参数问题,开展了一场专业且富有启发性的学术报告。本次报告由数学与统计学院承办,在南湖校区新图书馆5302室进行,会议由数学与统计学院统计系副主任王淑影教授主持,学院院长王纯杰教授、统计系党支部书记袁晓惠教授、学院部分老师和研究生参加了本次学术报告会。
会议开始之际,由王淑影老师作为代表对王海鹰老师的到来表示感谢,并对王老师及其研究内容做了简单的介绍。

报告人简介:王海鹰,康涅狄格大学统计学副教授,拥有密苏里大学博士学位(2013年)和中国科学院硕士学位(2006年)。研究方向涵盖大数据信息子数据选择、模型选择与平均、测量误差模型、最优设计以及半参数回归等领域。其研究成果发表于众多顶级期刊及会议,包括Biometrika、IEEE Transactions、Journal of the American Statistical Association、Journal of Machine Learning Research、ICML和NeurIPS。
报告题目:Two Types of Parameters in Subsampling for Massive Data
报告摘要:As massive datasets become the norm, subsampling has emerged as a crucial technique to make statistical computation feasible. This talk introduces the data-dependent subsampling approach, focusing on the critical distinction between two types of targets in subsampling: approximating the full-data estimator versus estimating the true population parameter. When the goal is to approximate a computationally intractable full-data estimator, conditional distributions are sufficient, and Inverse Probability Weighting (IPW) combined with optimal design (e.g., OSMAC) provides a robust solution, even under model misspecification. Conversely, when the goal is to infer the true population parameter, the unconditional distribution of the data becomes relevant, and unweighted approaches—such as likelihood-based methods—often yield significantly higher statistical efficiency, provided the model is correctly specified. We will discuss the theoretical properties of both approaches and explore their connections and differences. We will also point out some interesting facts regarding subsampling.


报告伊始,王老师以海量数据场景下的典型困境为切入点,面对250TB的完整数据,传统统计方法常因计算资源瓶颈而难以直接处理。子抽样方法便成为关键路径,若从250TB全数据中选取250MB子样本,虽精度不及全数据,却能以有限成本快速获取有效信息,而核心问题在于如何科学地选择这250MB数据。王老师指出,数据依赖型子抽样通过最优设计思想,选取能最小化估计量渐近方差的子样本,通常优于均匀子抽样。在此框架下,他引出了本次报告的核心议题,即子抽样中两类参数目标的根本区分。

随后,王老师系统阐释了两类方法各自的理论路径与适用场景。当目标是逼近全数据估计量时,只需关注给定全数据条件下子样本的条件分布,此时逆概率加权估计量能够有效修正采样偏差,通过最优设计为每个数据点分配合理的采样概率,使子样本估计量在A最优准则下尽可能逼近全数据估计量,即使在模型误设定情形下依然保持良好性能,这便是OSMAC方法的基本思路。而当目标转向推断真实总体参数时,数据的无条件分布变得重要,基于似然的无加权估计量凭借其对数据生成机制的直接建模,在模型正确设定时能够实现更高的统计效率。

在理论性质讲解环节,王老师通过线性回归模型实例,深入剖析了子抽样中若干容易被忽视却至关重要的问题。他以是否拟合截距项为例展开讨论,当真实模型包含非零截距时,若直接拟合无截距模型,普通最小二乘估计将产生偏差;对全数据进行中心化处理后拟合无截距模型虽可获得无偏估计,但从中心化后的全数据中抽取的子样本却往往不再保持中心化特征,此时是否应对子样本重新中心化便成为需要审慎对待的问题。这一讨论让在场师生深刻认识到,子抽样分析过程中隐含的模型设定与数据预处理方式均可能对最终结论产生实质性影响。

王老师进一步探讨了加权估计量与无加权估计量的深层联系。他指出,全数据估计量是真实总体参数的渐近有效估计,而在子抽样中,无加权估计量近似的是一个效率较低的全数据估计量,加权估计量近似的则是效率较高的全数据估计量。由于子样本量远小于全数据量,无加权估计量在估计真实总体参数时往往反而更有效率。但他同时强调,这一优势建立在模型正确设定的前提之上,一旦模型误设定,无加权估计量可能不再具有一致性,而逆概率加权估计量由于不依赖于模型结构的正确性,始终能保持一致估计,因而在模型不确定的情形下更具稳健性。


报告结束后,在场师生围绕报告内容与王老师展开了深入的交流与讨论。王老师对提出的问题进行了详细解答,并分享了自己的研究心得。讨论气氛热烈,学术氛围浓厚。与会师生纷纷表示受益匪浅,对子抽样方法的理论内涵和应用价值有了更为深入的认知。
初审:关迪
复审:杨凯
终审:王丹、王纯杰
数学与统计学院
2026年7月18日