对于数学建模国赛展示论文的研究
关于数学建模竞赛的延申。
对于数学建模国赛展示论文的研究
本文基于 2021—2025 年本科数学建模国赛的 31 篇官方展示论文整理材料,归纳方法选型、篇幅安排和数学表达中可以复用的经验。正文侧重“怎样建模、怎样写清楚”,附录提供方法与预处理清单,供学习和查阅。
阅读范围:方法样本共 31 篇,其中 2021 年 2 篇、2022 年 2 篇、2023 年 10 篇、2024 年 12 篇、2025 年 5 篇。篇幅分析另取 8 篇、合计 348 页,不能与 31 篇方法样本混为同一统计。本文讨论的是所收集的展示论文,不代表全部参赛论文,也不将展示资格视为所有方法均正确的保证。
一、结论如下
- 优秀论文的算法不是按新颖度选择,而是按问题结构分工。 机理模型负责定义对象,统计模型负责识别关系和不确定性,优化算法负责在明确目标与约束下搜索;三者不能互相替代。
- 最稳定的写法是“基础模型 → 必要改进 → 独立验证”。 直接堆叠多个高级算法而没有基线模型、消融实验或外样本检验,会使读者难以判断改进是否有效。
- 正文的主要篇幅应留给模型建立、求解和结果解释。 摘要、重述、假设、符号说明应短;附录可以很长,但不应反过来替正文承担变量定义、参数来源和验证。
- 数学严谨性主要体现为限定,而不是堆叠术语密度。 严谨的句子会交代对象、条件、参数来源、推导关系、误差和结论边界;“显然合理”“效果很好”则是明显的严谨性不足。
- 竞赛论文的完整证据闭环是“假设—模型—参数—求解—验证—结论”。 任何一环只给名称而不给证据,后面的精确小数都可能只是计算精细,而非认识可靠。
二、方法选择
2.1 样本中的方法分布
下表是基于原稿的统计,按“出现于多少篇论文”计数;类别会重叠,一篇论文可以同时属于多类。
| 方法族 | 涉及论文数 | 应解决的核心问题 |
|---|---|---|
| 机理、几何与物理建模 | 15 | 把物理过程、空间关系或运动过程写成可计算量 |
| 数学规划 | 7 | 在目标、资源、逻辑和容量约束下给出决策 |
| 元启发式优化 | 14 | 处理非凸、离散、黑箱或难以精确求解的搜索 |
| 数值搜索与求解 | 10 | 求根、临界点、反演参数或近似积分 |
| 蒙特卡洛与不确定场景 | 7 | 近似复杂概率/几何量或传播不确定性 |
| 回归与统计推断 | 12 | 解释关系、估计效应、检验差异与预测 |
| 降维、聚类与综合评价 | 6 | 压缩变量、发现分组或形成排序 |
| 树模型与神经网络 | 7 | 拟合复杂非线性或高阶交互 |
| 时间序列与频域分析 | 4 | 处理时间依赖、周期和频率结构 |
2.2 四条可复用的选型逻辑
先定义可计算的量,再优化
定日镜、测线、板凳龙、烟幕和薄膜干涉题都先回答“效率、覆盖、位置、遮蔽或厚度到底如何计算”,随后再使用二分、PSO、DE、GA 等搜索。若判定函数本身错了,优化器只会更快地找到错误模型的最优解。
通过数据结构决定统计模型
- 组成比例有定和约束:考虑 CLR 变换或 Dirichlet 回归,处理零值和成分间约束。
- 同一对象多次测量:考虑线性混合效应模型(LMM)等方法,显式处理组内相关。
- 销量具有时间依赖:用 ACF 诊断、VAR 等模型描述,并按时间切分训练与验证数据。
- 任务关注事件发生时间:考虑生存模型;存在删失时,必须在建模和评估中处理。DeepHit 是其中一种深度学习方案。
将预测与决策分层
蔬菜补货、种植与生产决策论文通常先估计销量、产量、次品率或价格,再进入规划。预测误差必须传递到决策层;只报告预测精度而不做决策敏感性,闭环的链路仍不完整。
用基线说明复杂算法的必要性
稳健的链条是:解析/线性/贪心基线 → 识别基线失败原因 → 加入非线性、随机性或全局搜索 → 与基线比较。复杂算法的必要性应来自“哪一条假设被放宽”,而不是“该算法更高级”。
2.3 选算法前的问题
- 对象:模型处理的是连续量、类别、序列、组成比例、重复测量、图还是空间几何?
- 任务:要解释、预测、分类、评价、优化,还是检验差异?不要用预测模型冒充因果解释。
- 假设:独立、线性、正态、平稳、凸性、闭合性等前提是否成立?
- 规模:样本量和决策维数是否支持该复杂度?可精确求解时为何要用元启发式?
- 验证:用什么独立证据证明模型和算法都不是只在当前样本上“自洽”?
2.4 选算法后的验证
在论文写作前,自我质证是一个十分重要的过程。 建完模型的那一刻,须立刻切换成评委角色,像攻击对手一样攻击自己的模型——每个假设、每个参数、每个数字,都问一句凭什么,然后当场给出证据。核心工具就是把质疑 → 证据做成一张表。
每个质疑,必须对应一种可计算的证据,而不是口头解释:
| 靶心 | 质疑 | 对应的证据长什么样 |
|---|---|---|
| 假设 | 过原点成立吗? | 截距显著性检验——截距不显著 → 过原点合理,有据可依 |
| 假设 | 线性成立吗? | 残差分析——残差随机分布无趋势 → 线性假设成立 |
| 假设 | 等权合理吗? | 与 AHP/熵权结果对比——若排序几乎不变 → 等权作为基线可接受 |
| 参数 | 参数从哪来? | 参数来源表——数值、单位、出处(题目/文献/假设)逐项列清 |
| 参数 | 参数靠谱吗? | 灵敏度分析——参数 ±10%,结论变化 <5% → 结论稳健 |
| 结论 | 这个数算对了吗? | 独立验证——合成数据回测 / 替代算法交叉印证 / 解析特例手工核对 |
| 结论 | 优化真的有效吗? | 消融对比表——baseline vs 改进,指标提升 + 代价逐行列清 |
证据必须是算出来的,不是说出来的。例如说过原点合理没用,须先算出截距 p 值 = 0.83,不显著,故合理——也就是把证据摆进论文。
正确的节奏是:靶心在哪,证据就打在哪。 一个问题里最重要的那个假设,值得花半页做假设检验;无关紧要的边角,一句「此处取默认值」带过即可。证据的密度要跟着风险走,不是均匀铺开。
三、篇幅与行文
3.1 篇幅分布
本节的篇幅统计覆盖 8 篇论文、合计 348 页。表中分别以全部 PDF 页数和剔除参考文献:
| 部分 | 占全部 PDF 页 | 剔除参考文献/附录后的占比 |
|---|---|---|
| 摘要 | 2.3% | 4.1% |
| 重述/分析/假设/符号 | 4.0% | 7.3% |
| 数据与预处理 | 2.0% | 3.6% |
| 模型建立与求解 | 44.5% | 80.3% |
| 检验/误差/灵敏度 | 1.7% | 3.1% |
| 评价/推广/结论 | 0.9% | 1.6% |
| 参考文献与附录 | 44.5% | — |
这些比例提示:把主要篇幅用于模型建立、求解与解释,把必要的验证就近放在结论之后。表中“检验/误差/灵敏度”的独立章节占比,不等于全部验证内容的占比;验证可能穿插在模型小节中。
3.2 用信息功能组织模型小节
一个小节建议按照以下顺序推进:
- 本节要计算什么;
- 为什么现有量不足,需要定义哪些变量;
- 基于什么假设建立关系;
- 推导目标函数/状态转移/统计模型;
- 参数从何而来,如何估计;
- 用什么算法求解,停止条件是什么;
- 输出什么结果;
- 如何检验,误差如何影响结论。
四、数学表达
4.1 严谨措辞
严谨性体现在读者能否追溯一个判断成立的条件。原稿中的措辞统计如下;由于未附完整的检索规则与文本范围,命中数适合作为观察线索,不宜解释为严格的语言学频率结论。
| 措辞功能 | 命中次数 | 每万字符约 | 真正承担的数学责任 |
|---|---|---|---|
| 定义与符号边界 | 110 | 16.6 | 说明对象、下标范围、单位与符号意义 |
| 推导与依据 | 60 | 9.0 | 把结论接回定理、前式、数据或已知条件 |
| 假设与适用条件 | 21 | 3.2 | 限定模型成立的世界,不把简化伪装成事实 |
| 约束与取值范围 | 23 | 3.5 | 排除数学上可算但现实中不可行的解 |
| 统计检验 | 15 | 2.3 | 交代显著性水平、原假设与证据强度 |
| 误差与稳健性 | 37 | 5.6 | 说明结论对噪声、步长、参数和场景是否敏感 |
| 审慎结论 | 40 | 6.0 | 区分“观察到、估计、支持”与“证明、因果” |
| 局限与改进 | 5 | 0.8 | 指出模型在哪些条件外可能失效 |
4.2 常见薄弱表述与建议的修改方式
| 薄弱写法 | 问题 | 修正方式 |
|---|---|---|
| “显然可得” | 省略关键推导 | 指明依据的公式、定理或给出中间式 |
| “模型效果很好” | 无评价指标和基线 | 报告指标、数据切分、基线和置信区间 |
| “结果符合实际” | 没有现实参照物 | 与题目范围、历史数据、量纲或解析特例对比 |
| “采用某算法进行求解” | 没有参数、停止条件和可复现性 | 给编码、初始化、种群/步长、迭代与停止准则 |
| “证明了A影响B” | 相关或预测被写成因果 | 改为“观察到相关/结果支持”,除非有识别设计 |
| “不拒绝原假设,因此二者相同” | 把证据不足写成等价证明 | 改为“未发现显著差异”,并报告检验功效/样本量 |
| “对数据归一化以提高准确率” | 目的含糊且可能泄漏 | 写清缩放公式,参数仅由训练集估计 |
| “使用多种算法相互验证” | 多模型可能共享同一错误假设 | 说明验证路径为何相对独立 |
4.3 从具体论文中理解严谨性的差异
- 2022-C229 在评价部分明确承认 Pearson 相关只能刻画线性关系,而正文未先检验线性前提。这种具体到模型假设的自我批评,比“模型仍有不足”更有信息量。
- 2022-C155/C229 对成分数据先做闭合与对数比处理,体现了“数据空间决定运算规则”;但卡方检验应明确检查并报告期望频数条件,“不拒绝原假设”也不等于证明独立。
- 2023-A、2024-A、2025-A 的严谨性主要来自几何对象、坐标系、判定条件与数值精度,而不是统计显著性。不同题型的“严谨”载体不同。
- 2025-B060/B157 先由光学机理导出可辨识关系,再以波谷、FFT/STFT 和非线性拟合交叉反演;真正关键是多种方法是否共享同一折射率假设,以及预处理是否改变条纹周期。
- 2025-C023/C132 使用重复测量和生存/集成模型时,训练验证必须按孕妇分组。若同一孕妇记录被随机分到训练与测试,指标再高也不构成可靠证据。
五、落实到写作
5.1 摘要
对每一问用 2—4 句完成:
- 任务与困难:本问要估计/分类/优化什么,难点是什么;
- 关键处理:数据或变量怎样转换;
- 模型与求解:为什么选择该模型,用什么算法求解;
- 数字结果与验证:给最关键结果,并说明如何验证。
模范论文常用“针对问题一……首先……随后……最终……”建立问题顺序。可以借用其导航功能,但不能把摘要写成算法名流水账。算法名后至少补一个动作对象,例如“采用二分法搜索首次碰撞时刻”,而非“采用二分法求解”。
5.2 正文
每个核心模型至少形成如下闭环:
变量定义 → 假设 → 关系式 → 参数来源 → 求解器 → 数值结果 → 验证 → 结论边界
可以把它当作审稿时的八格检查表。缺一格并非必然错误,但必须说明为何不需要。例如纯解析推导未必需要训练集,统计预测则必须说明数据切分。
5.3 完稿前的复核
- 对象一致:题意、符号、代码和结果中的变量含义一致,单位与下标完整。
- 理由充分:每个复杂方法都说明解决了什么困难,并有可比较的基线。
- 参数可追溯:阈值、权重、初值和超参数都有来源或选择过程。、
- 验证匹配任务:时间数据按时间验证,重复测量按对象分组;几何问题检查步长、网格与边界。
- 结果不过度解释:区分相关与因果、局部解与全局最优、未发现差异与证明等价。
- 结论能够落地:不仅给数值,还交代可执行方案、适用范围和主要误差来源。
带着这些问题再读展示论文,方法名才会变成可以理解、复现和取舍的工具。下面的附录可作为查阅入口:先定位问题结构,再阅读具体方法,最后用论文编号回到案例。
附录 A:59 类方法详解
本附录依据《2021—2025 本科数学建模国赛官方展示论文:算法与数据预处理学习手册》整理,保留其 59 个方法条目及原编号。为便于检索,将手册分散的两组“回归与预测”合并到同一类别,因此局部编号并非连续。
这里的“方法”包括统计模型、变换、优化算法、数值计算和机理建模,并非 59 个彼此独立的算法。每条“论文出处”均为手册所列示例,不应据此反算正文的方法族频次。公式为便于阅读重新排版的核心表达,不代替完整推导;若涉及具体实现,应回到对应论文核对参数与条件。
手册中的少数概括性说法在整理时作了限定,包括 CLR 的零和约束、VAR 的参数规模、CVaR 的尾部比例、生存分析的适用条件及整数规划的最优性表述;这些属于编辑说明,不表示原论文已经完成了相应检验。
A.1 统计与探索
方法 01|描述统计与可视化
用均值、中位数、标准差、偏度、峰度和图形先摸清尺度、离群、长尾与周期。
核心表达:均值 $\bar{x}=n^{-1}\sum_i x_i$;样本方差 $s^2=(n-1)^{-1}\sum_i(x_i-\bar{x})^2$。偏度和峰度分别刻画分布的不对称性与尾部特征。
- 关键参数:统计口径、时间粒度、分组层级、是否稳健统计。
- 适用场景:任何数据题的第一步,尤其销量、成本、产量和实验数据。
- 优点:解释直接、成本低,可暴露建模假设。
- 局限:不能说明因果;均值易被极端值拉动。
- 常见误用:只画图不解释;把偏态分布仍用均值±标准差概括。
- 论文出处:2023-C050、2023-C228、2024-C038/C063
方法 02|Pearson相关系数
衡量两个连续变量的线性同步程度。
核心表达:$r=\dfrac{\sum_i(x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum_i(x_i-\bar{x})^2\sum_i(y_i-\bar{y})^2}}$。
- 关键参数:显著性水平α、样本量、是否控制混杂。
- 适用场景:近似连续、线性、无强离群时。
- 优点:简单、可检验、便于热力图展示。
- 局限:只识别线性;离群敏感;相关不等于因果。
- 常见误用:未看散点图就直接解释;时间序列共同趋势造成伪相关。
- 论文出处:2022-C229、2023-C050、2025-C132
方法 03|Spearman秩相关
把数值换成秩后计算相关,判断单调关系。
核心表达:$\rho=\operatorname{corr}(\operatorname{rank}X,\operatorname{rank}Y)$。无并列秩时,$\rho=1-\dfrac{6\sum_i d_i^2}{n(n^2-1)}$。
- 关键参数:并列秩处理、α、样本量。
- 适用场景:非正态、异常值较多、关系单调但非线性时。
- 优点:稳健、对量纲不敏感。
- 局限:仍不能说明因果;非单调关系可能接近0。
- 常见误用:把ρ当斜率;忽略同一对象重复测量。
- 论文出处:2022-C229、2023-C050、2024-C038
方法 04|偏相关分析
先剔除控制变量的线性影响,再研究两变量净相关。
核心表达:$r_{xy\cdot z}=\dfrac{r_{xy}-r_{xz}r_{yz}}{\sqrt{(1-r_{xz}^2)(1-r_{yz}^2)}}$,这里给出控制单个变量 $z$ 的情形。
- 关键参数:控制变量集合、线性假设、样本量。
- 适用场景:替代/互补分析中需控制价格、季节等混杂时。
- 优点:比普通相关更接近“净关系”。
- 局限:漏控或错控变量仍会偏;不等于因果。
- 常见误用:控制了中介变量后作因果解释。
- 论文出处:2023-C228
A.2 统计检验
方法 05|Pearson卡方检验与Yates校正
比较列联表的观察频数与独立假设下期望频数。
核心表达:$\chi^2=\sum_i (O_i-E_i)^2/E_i$。Yates 校正用于 $2\times2$ 列联表的连续性修正;不能用它替代对稀疏频数条件的检查。
- 关键参数:α、自由度、期望频数阈值。
- 适用场景:两个分类变量是否关联。
- 优点:实现简单、结论清楚。
- 局限:小样本期望频数过低时近似失效。
- 常见误用:期望频数不满足仍硬用卡方;把显著性当效应大小。
- 论文出处:2022-C155、2022-C229
方法 06|Shapiro–Wilk正态性检验
比较排序样本与正态分布期望顺序统计量的一致性。
核心表达:$W=\dfrac{(\sum_i a_i x_{(i)})^2}{\sum_i(x_i-\bar{x})^2}$,其中 $x_{(i)}$ 为排序后的观测值,$a_i$ 为检验权重。
- 关键参数:α、样本量、检验对象应是残差还是原值。
- 适用场景:决定是否采用正态型检验或识别销量非正态。
- 优点:小中样本检验力较好。
- 局限:大样本对轻微偏离也显著。
- 常见误用:检验原始Y非正态就否定线性回归;真正关键常是残差。
- 论文出处:2023-C126、2025-B157
方法 07|Wilcoxon配对符号秩检验
对配对差值排序,检验差值分布中心是否为0。
核心表达:对非零配对差值的绝对值排序,分别计算正差与负差的秩和,再按检验约定构造统计量。
- 关键参数:配对方式、α、零差处理。
- 适用场景:两组相关系数或配对指标不宜假设正态时。
- 优点:非参数、对异常值较稳健。
- 局限:检验的是位置差异,信息利用少于参数法。
- 常见误用:把独立样本当配对样本;只报p值。
- 论文出处:2022-C229
方法 08|似然比/Wald检验与AIC/BIC
用似然差或系数/标准误检验模型项;AIC/BIC在拟合与复杂度间折中。
核心表达:$LR=2(\ell_1-\ell_0)$;单参数 Wald 统计量 $W=(\hat\beta/\operatorname{SE})^2$;$AIC=2k-2\ell$;$BIC=k\ln n-2\ell$。
- 关键参数:嵌套关系、自由度、参数数k、样本量n。
- 适用场景:混合效应模型选项、比较随机效应或非线性项。
- 优点:适用于复杂概率模型,可进行模型选择。
- 局限:依赖模型设定;AIC/BIC不是预测准确率。
- 常见误用:拿非嵌套模型做LR;把AIC下降直接说成提升百分比准确率。
- 论文出处:2025-C023、2025-C132
方法 09|多重检验FDR控制
在大量同时检验中控制错误发现比例,常用Benjamini–Hochberg。
核心表达:将 $m$ 个 $p$ 值从小到大排序,取满足 $p_{(k)}\le kq/m$ 的最大 $k$,拒绝前 $k$ 个原假设;若不存在则不拒绝。
- 关键参数:目标FDR q、检验数m、依赖结构。
- 适用场景:多个染色体/分层Z检验同时判定时。
- 优点:比Bonferroni有更高检出力。
- 局限:控制的是期望假发现比例,不保证每次零假阳性。
- 常见误用:把q值当单个样本出错概率。
- 论文出处:2025-C023
A.3 回归、降维与结构化数据建模
方法 10|普通/多元最小二乘回归
寻找使残差平方和最小的线性关系。
核心表达:$\min_\beta\sum_i(y_i-x_i^\top\beta)^2$;当 $X$ 满列秩时,$\hat\beta=(X^\top X)^{-1}X^\top y$。
- 关键参数:变量选择、交互项、残差结构、多重共线性。
- 适用场景:解释因素影响、建立局部近似、拟合坡面。
- 优点:可解释、计算快、统计推断成熟。
- 局限:非线性、异方差、强共线性时易失真。
- 常见误用:对时间序列忽略自相关;以高R^2代替外样本验证。
- 论文出处:2021-B050、2023-B226、2023-C050
方法 11|逐步回归
按显著性或信息准则逐项加入/删除变量。
核心表达:按前向、后向或双向规则选择变量,使用显著性阈值或 AIC 等准则决定进入和剔除。
- 关键参数:进入/剔除阈值、候选变量、交互层级。
- 适用场景:候选变量较多、需要简化解释模型时。
- 优点:快速、结果紧凑。
- 局限:选择不稳定、p值偏乐观、易过拟合。
- 常见误用:把自动选择当科学发现;不做交叉验证。
- 论文出处:2021-B050
方法 12|多项式/指数/非线性曲线拟合
用具有领域形状的函数逼近趋势。
核心表达:多项式 $y=\sum_j\beta_jx^j$;指数曲线 $y=ae^{bx}$;非线性最小二乘 $\min_\theta\sum_i e_i(\theta)^2$。
- 关键参数:阶数、初值、参数边界、损失函数。
- 适用场景:实验温度效应、光谱物理曲线、局部平滑趋势。
- 优点:直观、参数可解释。
- 局限:高阶多项式外推不稳;非线性优化依赖初值。
- 常见误用:只比较训练R^2;在观测区间外远距离外推。
- 论文出处:2021-B050、2025-B060/B157
方法 13|主成分分析PCA
把相关变量旋转成少量互不相关、方差最大的主成分。
核心表达:对中心化数据的协方差矩阵作特征分解 $S=V\Lambda V^\top$,沿特征向量计算主成分得分 $z=Xv$。
- 关键参数:标准化、保留成分数、累计解释率。
- 适用场景:共线性强、需降维后回归或综合指标时。
- 优点:降维、去共线性、可视化。
- 局限:主成分按方差而非预测价值;解释变弱。
- 常见误用:不同量纲未标准化;仅凭解释率选成分。
- 论文出处:2021-B050
方法 14|中心化对数比变换CLR
将各成分除以组成向量的几何均值后取对数,使分析转向相对比例;CLR 结果仍位于分量和为零的子空间,并未产生相互独立的普通变量。
核心表达:$\operatorname{clr}(x_i)=\ln[x_i/g(x)]$,其中 $g(x)=(\prod_{j=1}^{D}x_j)^{1/D}$。各变换分量之和为零。
- 关键参数:零值替换、伪计数、成分封闭范围。
- 适用场景:比例成分总和约为100%的玻璃化学数据。
- 优点:避免伪相关,使欧氏方法更合理。
- 局限:无法直接处理0;变换后协方差奇异。
- 常见误用:对0直接取对数;把CLR系数当原比例绝对变化。
- 论文出处:2022-C155、2022-C229
方法 15|Dirichlet回归
直接为总和为1的多维比例向量建模。
核心表达:$Y\sim\operatorname{Dirichlet}(\alpha_1,\ldots,\alpha_D)$。可令 $\alpha_j=\phi\mu_j$,以 $\log(\mu_j/\mu_{\mathrm{ref}})=x^\top\beta_j$ 建模均值比例,并另行指定精度参数 $\phi$。
- 关键参数:链接函数、参考成分、精度参数、零值处理。
- 适用场景:同时预测多个化学成分比例。
- 优点:天然保证预测为正且和为1。
- 局限:不能含结构性0;方差结构限制较强。
- 常见误用:先随意填0再拟合;忽略组成部分间约束。
- 论文出处:2022-C229
方法 16|偏最小二乘/PLS-DA
寻找既解释X又与Y最相关的潜变量;PLS-DA把Y编码为类别。
核心表达:构造潜变量 $t=Xw$,在规范化等约束下寻找与响应协方差较大的方向;PLS-DA 使用类别响应编码。
- 关键参数:潜变量数、缩放、VIP阈值、交叉验证。
- 适用场景:小样本、高维、强共线的化学成分分类。
- 优点:兼顾降维与预测。
- 局限:易因成分数选择不当过拟合。
- 常见误用:先用全数据选变量再交叉验证,造成泄漏。
- 论文出处:2022-C229
方法 17|双对数需求/价格弹性模型
销量与价格同时取对数,价格系数就是弹性。
核心表达:$\ln Q=\alpha+\beta\ln P+\cdots$,模型中的价格弹性为 $\partial\ln Q/\partial\ln P=\beta$。
- 关键参数:控制变量、零销量处理、内生性、时间固定效应。
- 适用场景:定价—需求关系与弹性估计。
- 优点:解释方便、相对变化尺度自然。
- 局限:价格常与需求同时决定,OLS可能内生偏误。
- 常见误用:把相关系数或回归β直接当因果弹性。
- 论文出处:2023-C228
方法 21|贝叶斯模型与MCMC
把未知参数视为随机变量,用先验×似然得到后验,再用马尔可夫链抽样。
核心表达:$p(\theta\mid y)\propto p(y\mid\theta)p(\theta)$;MCMC 用相关抽样近似后验分布及其积分。
- 关键参数:先验、链数、迭代/燃烧、步长、收敛诊断、MC误差。
- 适用场景:零膨胀/层级销量、参数不确定性需要完整表达时。
- 优点:能给区间与概率、可融入先验。
- 局限:计算慢、对先验和模型设定敏感。
- 常见误用:只跑一条链;只看轨迹“像稳定”;不报告有效样本量。
- 论文出处:2023-C126
方法 22|线性混合效应模型LMM/REML
固定效应描述总体规律,随机截距/斜率刻画同一孕妇重复测量和个体差异。
核心表达:$y=X\beta+Zu+\varepsilon$,其中 $u\sim N(0,G)$、$\varepsilon\sim N(0,R)$,通常假设两者独立。
- 关键参数:固定项、随机效应结构、REML/ML、协方差结构。
- 适用场景:纵向重复测量、组内相关明显时。
- 优点:兼顾总体解释与个体异质性。
- 局限:随机结构复杂时估计不稳;仍依赖分布与线性假设。
- 常见误用:把同一人的多次检测当独立样本;随机效应结构不检验。
- 论文出处:2025-C023、2025-C132
方法 23|高斯过程回归GPR
在函数空间设高斯先验,观测后得到任一点的预测分布。
核心表达:$f\sim GP(m,k)$,$y=f(x)+\varepsilon$;核函数 $k$ 决定函数值之间的协方差结构。
- 关键参数:核函数、长度尺度、噪声方差、均值函数。
- 适用场景:小中样本、需要非线性预测与不确定区间时。
- 优点:能够同时给出预测均值与模型假设下的不确定区间。
- 局限:标准实现O(n^3),高维核选择困难。
- 常见误用:用后验均值阈值而忽略预测不确定性。
- 论文出处:2025-C132
方法 24|生存分析与DeepHit
把“首次达到阈值的孕周”视为时间到事件;DeepHit直接预测各离散时点的事件概率。
核心表达:用事件时间的离散概率分布或累计分布描述何时发生事件;DeepHit 的训练目标通常结合似然与排序损失。
- 关键参数:时间网格、删失定义、网络结构、损失权重。
- 适用场景:达标时间预测、存在未达标或随访截止时。
- 优点:正确处理时间与删失;可个体化。
- 局限:深度模型数据需求大、校准与解释困难。
- 常见误用:未依据“时间到事件”的任务结构选模;忽略删失或仅报告普通分类准确率。没有删失并不意味着不能使用生存模型。
- 论文出处:2025-C132
A.4 时间序列
方法 18|ACF与时间序列分解
ACF衡量滞后相关;分解把序列拆成趋势、季节与残差。
核心表达:弱平稳条件下 $\rho(k)=\operatorname{Cov}(y_t,y_{t-k})/\operatorname{Var}(y_t)$;加法分解 $y_t=T_t+S_t+R_t$,乘法分解 $y_t=T_tS_tR_t$。
- 关键参数:滞后阶、周期、加法/乘法、平滑窗口。
- 适用场景:销量周期、季节性和趋势诊断。
- 优点:可解释、帮助选预测结构。
- 局限:结构变化或缺失会干扰;不是预测模型本身。
- 常见误用:看见ACF峰就断言因果周期;未去趋势。
- 论文出处:2023-C228
方法 19|VAR向量自回归
多变量互相用各自和彼此的滞后预测。
核心表达:$y_t=c+A_1y_{t-1}+\cdots+A_py_{t-p}+\varepsilon_t$。若有 $K$ 个变量,滞后系数数量为 $K^2p$。
- 关键参数:滞后阶p、平稳性、变量数、样本量。
- 适用场景:多个菜品销量/损耗/次数相互影响的短期预测。
- 优点:能描述动态交互。
- 局限:滞后系数数量随变量数平方增长、随滞后阶线性增长;常规平稳 VAR 需检查平稳性,不能忽略共同趋势。
- 常见误用:小样本塞入过多变量;不做单位根和残差诊断。
- 论文出处:2023-C126
方法 20|LSTM长短期记忆网络
用门控单元决定保留、遗忘和输出历史信息。
核心表达:$f_t=\sigma(W_f[h_{t-1},x_t]+b_f)$,$c_t=f_t\odot c_{t-1}+i_t\odot\tilde c_t$;门控机制调节记忆的保留与更新。
- 关键参数:窗口长度、隐藏单元、层数、学习率、dropout、轮数。
- 适用场景:非线性时序、较长依赖、数据量足够时。
- 优点:表达能力强、可联合多特征。
- 局限:数据少时不稳;解释弱;训练和调参成本高。
- 常见误用:随机切分时间数据;以训练R^2宣称预测可靠。
- 论文出处:2023-C228、2025-C132
A.5 机器学习
方法 25|BP神经网络/多层感知机
多层非线性映射,用误差反向传播更新权重。
核心表达:按损失函数的梯度更新参数:$W\leftarrow W-\eta,\partial L/\partial W$。
- 关键参数:隐藏层/神经元、激活函数、学习率、正则化、训练轮数。
- 适用场景:复杂非线性回归、静态特征融合。
- 优点:通用逼近能力强。
- 局限:小样本易过拟合;解释性弱。
- 常见误用:隐藏单元凭试到最好却不留验证集;输入未缩放。
- 论文出处:2021-B050、2025-C132
方法 26|决策树
用特征阈值递归切分,使子节点更纯。
核心表达:递归选择使信息增益最大或基尼不纯度下降最大的切分;回归树则按平方误差等准则划分。
- 关键参数:最大深度、最小叶样本、剪枝、特征候选。
- 适用场景:规则式分类、需要解释阈值时。
- 优点:可视化、非线性、无需缩放。
- 局限:单树高方差,易过拟合。
- 常见误用:样本很小却得到100%准确率即宣称泛化完美。
- 论文出处:2022-C155、2022-C229、2024-B196
方法 27|随机森林
对自助样本训练多棵随机子特征树并投票/平均。
核心表达:分类预测为各树投票 $\hat y=\operatorname{mode}{T_b(x)}$;回归预测取各树输出的均值。
- 关键参数:树数、最大深度、每次候选特征数、叶样本。
- 适用场景:非线性表格数据、插值拟合、变量重要性。
- 优点:稳健、少预处理、能拟合交互。
- 局限:外推差、解释是近似的。
- 常见误用:把特征重要性当因果;训练测试空间重叠。
- 论文出处:2023-B477
方法 28|梯度提升树/LightGBM
逐轮拟合当前残差/负梯度;LightGBM以高效直方图和叶优先生长实现。
核心表达:$F_m(x)=F_{m-1}(x)+\eta h_m(x)$,新树拟合当前损失所对应的改进方向。
- 关键参数:树数、学习率、叶数/深度、采样、正则。
- 适用场景:结构化数据分类,非线性与交互较多时。
- 优点:预测强、缺失处理方便。
- 局限:调参多;小样本很容易过拟合。
- 常见误用:先用全数据调Optuna再评估;类别极不平衡只看准确率。
- 论文出处:2022-C155(GBDT)、2025-C132(LightGBM)
方法 29|K-means/K-means++
最小化样本到所属质心的平方距离;++用分散的初始中心改善稳定性。
核心表达:$\min_{{c_i},{\mu_k}}\sum_i\lVert x_i-\mu_{c_i}\rVert_2^2$。K-means++ 改进初始化,并不改变这一目标。
- 关键参数:K、缩放、初始化、重复次数、距离。
- 适用场景:按销量特征或玻璃成分做无监督分组。
- 优点:简单快速、结果直观。
- 局限:偏好球状、相近大小簇;异常值敏感。
- 常见误用:不同量纲不标准化;用业务希望的K而无轮廓系数/稳定性。
- 论文出处:2022-C229、2023-C050
方法 30|R型与Q型聚类
R型聚变量,Q型聚样本;先R后Q可先筛冗余特征再分样本。
核心表达:R 型以变量为聚类对象,Q 型以样本为聚类对象;两者仍需具体指定距离、链接或划分算法。
- 关键参数:距离、链接方式、簇数、缩放。
- 适用场景:化学成分变量筛选与玻璃亚类划分。
- 优点:适合探索变量与样本双重结构。
- 局限:结果依赖距离与标准化。
- 常见误用:把聚类标签当真实类别;不做扰动稳定性。
- 论文出处:2022-C155
方法 31|堆叠集成与Optuna
基模型输出作为元特征,再训练元模型;Optuna用序贯搜索调超参。
核心表达:$\hat y=g(f_1(x),\ldots,f_K(x))$,也可加入原始特征。训练元模型时,基模型预测必须来自折外预测。
- 关键参数:折数、基模型、元模型、搜索空间、试验次数。
- 适用场景:基模型误差具有互补性,且数据量允许可靠的折外预测与独立评估时;小样本下尤其需要谨慎。
- 优点:可融合互补误差。
- 局限:数据泄漏风险极高;复杂度增加。
- 常见误用:元特征不是out-of-fold生成;调参和评估共用验证集。
- 论文出处:2025-C132
A.6 关联规则挖掘
方法 32|FP-Growth关联规则
用FP树压缩事务数据,挖掘频繁项集而无需反复候选生成。
核心表达:$\operatorname{conf}(X\to Y)=\operatorname{supp}(X\cup Y)/\operatorname{supp}(X)$;$\operatorname{lift}(X\to Y)=\operatorname{conf}(X\to Y)/\operatorname{supp}(Y)$。
- 关键参数:最小支持度、置信度、提升度。
- 适用场景:购物篮中单品共同出现关系。
- 优点:比Apriori高效,规则易读。
- 局限:高频不等于强业务关系;稀有重要组合可能漏掉。
- 常见误用:只看置信度不看基准概率/提升度。
- 论文出处:2023-C228
A.7 综合评价与关联度
方法 33|灰色关联分析
比较标准化序列曲线的接近程度。
核心表达:$\xi_i(k)=\dfrac{\Delta_{\min}+\rho\Delta_{\max}}{\Delta_i(k)+\rho\Delta_{\max}}$,再对关联系数加权平均。
- 关键参数:分辨系数ρ、正向化/归一化、权重。
- 适用场景:小样本、多指标、缺乏明确分布假设的关联排序。
- 优点:计算简单、样本要求低。
- 局限:尺度处理与参考序列主观;不是统计显著性。
- 常见误用:把关联度称为相关系数或因果效应。
- 论文出处:2022-C155、2023-C050
方法 34|TOPSIS多指标评价
最佳方案应离正理想解近、离负理想解远。
核心表达:$C_i=D_i^-/(D_i^++D_i^-)$,其中 $D_i^+$、$D_i^-$ 分别为到正、负理想解的距离。
- 关键参数:指标正向化、标准化、权重、距离度量。
- 适用场景:供应商综合重要性排序。
- 优点:透明、便于综合多指标。
- 局限:权重和补偿性会改变排序。
- 常见误用:指标重复导致双重计权;排序后不做敏感性分析。
- 论文出处:2021-C066
A.8 优化与决策
方法 35|线性/0-1/混合整数规划
用线性目标和约束表达资源分配;0-1变量表达是否选择。
核心表达:$\max c^\top x$,满足 $Ax\le b$ 及变量边界;部分变量可要求为整数或 $x_j\in{0,1}$。
- 关键参数:决策粒度、Big-M、整数变量、约束上下界。
- 适用场景:种植、订购、运输、检测选择。
- 优点:目标与约束表达清晰;在满足条件并完成相应求解时,可给出最优性证据或最优性间隙。提前终止的整数规划解不自动等于全局最优。
- 局限:整数规模大时求解慢;非线性关系需线性化。
- 常见误用:Big-M过大;把“面积不宜太小”等自然语言漏掉或随意定值。
- 论文出处:2021-C066、2024-C038/C063/C094
方法 36|非线性规划
目标或约束含非线性,用连续优化器寻找可行极值。
核心表达:$\min_x f(x)$,满足 $g_i(x)\le0$、$h_j(x)=0$ 及变量边界。
- 关键参数:初值、边界、容差、梯度、约束处理。
- 适用场景:定价弹性、光学效率、连续运动参数优化。
- 优点:表达真实关系更自然。
- 局限:常非凸,可能只得局部最优。
- 常见误用:只给一个解不说明初值/多起点;把求解器成功当全局最优。
- 论文出处:2021-B050、2023-C228、2025-A196
方法 37|动态规划与记忆化
把问题拆成有重叠子问题,用状态转移累积最优值。
核心表达:确定性转移下,$V_t(s)=\max_a{r_t(s,a)+V_{t+1}(T_t(s,a))}$;随机转移需对下一状态取条件期望。
- 关键参数:状态、动作、阶段、边界、离散精度。
- 适用场景:多阶段检测拆解决策、分段边界与检测时点。
- 优点:能利用最优子结构,结果可追溯。
- 局限:状态爆炸;离散会带来近似误差。
- 常见误用:状态遗漏历史依赖;把贪心递推误称动态规划。
- 论文出处:2021-C066、2024-B159、2025-C023
方法 38|遗传算法GA
把候选方案编码成染色体,经选择、交叉、变异迭代。
核心表达:候选方案编码 → 适应度评价 → 选择、交叉、变异 → 新种群,反复迭代并检查可行性。
- 关键参数:种群、代数、交叉率、变异率、精英数、编码。
- 适用场景:离散连续混合、非凸、黑箱目标。
- 优点:适用广、无需梯度。
- 局限:计算多、无全局最优保证、结果随机。
- 常见误用:不报告随机种子和重复稳定性;罚函数尺度失衡。
- 论文出处:2021-C066、2023-A092、2024-B196/C234、2025-C132
方法 39|差分进化DE与DEGA
DE用个体差向量生成变异;DEGA把差分变异融入GA提升搜索。
核心表达:典型变异式为 $v_i=x_{r_1}+F(x_{r_2}-x_{r_3})$,再进行交叉和选择。
- 关键参数:缩放因子F、交叉率CR、种群、边界修复。
- 适用场景:连续高维、非凸,或希望增强GA局部/全局平衡。
- 优点:参数少、连续优化常有效。
- 局限:离散约束需专门编码;仍是随机近似。
- 常见误用:把一次更优结果当算法必然优越。
- 论文出处:2024-C038(DEGA)、2025-A196(DE)
方法 40|粒子群PSO/GBest-PSO
粒子由自身最好与群体最好位置共同牵引。
核心表达:$v_i\leftarrow\omega v_i+c_1r_1(p_i^{\mathrm{best}}-x_i)+c_2r_2(g^{\mathrm{best}}-x_i)$,随后更新 $x_i\leftarrow x_i+v_i$。
- 关键参数:ω、c_1、c_2、粒子数、迭代、速度/边界。
- 适用场景:连续黑箱、多峰优化;定价、螺距、拟合。
- 优点:实现简洁、收敛快。
- 局限:易早熟,处理复杂离散约束困难。
- 常见误用:无约束修复;只与“平均方案”比较而不与强基线比较。
- 论文出处:2023-B226、2023-C228、2024-A053/A242、2025-A196
方法 41|模拟退火SA
允许以随温度下降的概率接受劣解,以跳出局部最优。
核心表达:最小化问题中,若目标恶化量为 $\Delta>0$,以 $\exp(-\Delta/T)$ 的概率接受劣解。
- 关键参数:初温、降温率、马尔可夫链长度、终温、邻域。
- 适用场景:组合路径、补货定价、多峰优化。
- 优点:机制直观、可跳出局部最优。
- 局限:参数敏感、慢、单次结果波动。
- 常见误用:降温过快退化成贪心;无多次运行统计。
- 论文出处:2023-B226、2023-C050、2024-B195
方法 42|贪心算法
每一步选当前最有利动作,希望构成好解。
核心表达:按局部评价规则选择当前动作,立即更新剩余资源与可行域,直至构造完整方案。
- 关键参数:排序指标、破局规则、回溯/修复。
- 适用场景:测线逐条布设、快速种植基线。
- 优点:快、易解释、适合做基准。
- 局限:一般不保证全局最优。
- 常见误用:没有交换论证却称最优;忽略早期选择锁死后续。
- 论文出处:2023-B226/B477、2024-C094
方法 43|多目标规划、主要目标法与Pareto
同时处理收益、需求、漏测等冲突目标;Pareto解不能在不牺牲其他目标下继续改进。
核心表达:同时考虑 $[f_1(x),\ldots,f_m(x)]$。主要目标法优化一个目标,并将其他目标转为带阈值的约束;Pareto 解表示非支配的权衡方案。
- 关键参数:目标尺度、优先级、ε阈值、决策偏好。
- 适用场景:收益与需求、长度与漏测/重叠冲突时。
- 优点:保留权衡信息。
- 局限:最终选解仍需价值判断。
- 常见误用:未经标准化直接加权;把某个Pareto点称唯一最优。
- 论文出处:2021-C066、2023-B311、2023-C228
方法 44|NSGA-II与混合编码/约束违反CV
按非支配等级和拥挤距离选择,维持Pareto前沿多样性;混合编码同时表示二元与实数变量。
核心表达:以快速非支配排序和拥挤距离维护解集;约束违反量 CV 汇总不可行程度,混合编码分别表示离散与连续变量。
- 关键参数:种群、代数、交叉/变异、编码、CV尺度。
- 适用场景:单品选择(二元)+补货定价(连续)的多目标问题。
- 优点:一次得到多种权衡方案。
- 局限:计算昂贵、约束与编码设计复杂。
- 常见误用:论文OCR把NSGA-II误成III需回看原文;只展示漂亮前沿不检验可行性。
- 论文出处:2023-C228
方法 45|蚁群算法ACO
人工蚂蚁按信息素与启发值构造路径,优质路径增强信息素。
核心表达:$P_{ij}\propto\tau_{ij}^{\alpha}\eta_{ij}^{\beta}$;$\tau_{ij}\leftarrow(1-\rho)\tau_{ij}+\Delta\tau_{ij}$。概率还需在可行动作集合内归一化。
- 关键参数:蚂蚁数、α、β、挥发率ρ、迭代。
- 适用场景:离散决策路径、组合优化。
- 优点:正反馈、便于编码路径。
- 局限:易早熟、参数多。
- 常见误用:用在很小枚举空间反而复杂;不与穷举核对。
- 论文出处:2024-B196
方法 46|飞蛾火焰算法MFO
候选解沿对数螺旋向精英“火焰”移动。
核心表达:$M_i\leftarrow S(M_i,F_j)$,其中 $S$ 表示围绕精英位置 $F_j$ 的螺旋更新规则。
- 关键参数:种群、火焰数、螺旋参数、迭代、边界。
- 适用场景:连续路径搜索或复杂黑箱优化。
- 优点:结构简单、探索性较强。
- 局限:理论与稳定性弱于成熟优化器,易被包装性使用。
- 常见误用:“改进”只改名字/参数却无消融实验。
- 论文出处:2023-B477
方法 47|随机规划、场景模拟与蒙特卡洛
从不确定分布抽取场景,在多种未来下比较期望收益和风险。
核心表达:$\max_x\mathbb E_\xi[f(x,\xi)]\approx\max_x N^{-1}\sum_{s=1}^N f(x,\xi_s)$。蒙特卡洛也可独立用于积分、概率或几何量估计。
- 关键参数:分布、场景数N、相关结构、随机种子。
- 适用场景:产量、销量、成本、价格波动;光线/镜面抽样。
- 优点:直观、可兼容复杂模型。
- 局限:结果依赖分布与场景覆盖;计算成本高。
- 常见误用:独立抽样破坏变量相关;场景少却声称稳健。
- 论文出处:2023-A0165/A0175/A092、2024-C063/C094/C234
方法 48|CVaR与鲁棒优化
CVaR 在置信水平 α 下刻画损失分布上尾风险;连续分布时可理解为最差 1−α 比例情形的平均损失。鲁棒优化则针对指定不确定集合求解。
核心表达:$\operatorname{CVaR}\alpha(L)=\min\eta{\eta+\mathbb E[(L-\eta)+]/(1-\alpha)}$,其中 $(u)+=\max(u,0)$。
- 关键参数:置信水平α、风险权重、不确定集/半径。
- 适用场景:农业利润既要高又怕极端坏年。
- 优点:风险含义清楚、能抑制尾部损失。
- 局限:参数主观且可能保守。
- 常见误用:把CVaR直接与利润同向相加而符号错误;用敏感性分析冒充鲁棒优化。
- 论文出处:2024-C038
方法 49|乐观准则与最大期望准则
乐观准则看每方案最好结果;最大期望按场景概率加权。
核心表达:收益矩阵为 $a_{ij}$ 时,乐观准则取 $\max_i\max_j a_{ij}$;最大期望准则取 $\max_i\sum_jp_ja_{ij}$。
- 关键参数:场景概率、决策者风险偏好。
- 适用场景:多个候选种植方案在不确定环境下择优。
- 优点:简单、可解释。
- 局限:乐观准则风险极高;期望忽略尾部。
- 常见误用:场景概率由随意频数产生;不报告最坏结果。
- 论文出处:2024-C063
方法 50|分层优化、任务分配与局部网格
先解离散任务分配,再在低维子问题中优化连续参数,最后局部细搜。
核心表达:任务分配 → 子问题中的连续参数优化 → 局部精细搜索,并复核不同层次之间的耦合约束。
- 关键参数:分层规则、子问题边界、网格步长、多起点。
- 适用场景:多无人机、多烟幕、多目标的高维协同。
- 优点:显著降维、便于解释和实现。
- 局限:层间耦合被切断,可能错过全局最优。
- 常见误用:先分配规则未经比较;局部网格范围由结果倒推。
- 论文出处:2025-A196
A.9 数值求解
方法 51|二分/三分/变步长/多起点搜索
二分求根依赖连续性及根的有效括区间,二分搜索可行边界依赖单调性;三分依赖单峰结构。变步长先粗后细,多起点降低局部解风险。
核心表达:二分逐次折半定位根或单调边界;三分依赖单峰结构;变步长逐级细化;多起点比较不同初始位置的结果。
- 关键参数:初始区间、单调/单峰证明、容差、步长序列、起点数。
- 适用场景:碰撞时刻、最小螺距、最大速度、连续参数黑箱。
- 优点:透明、稳定、易复核。
- 局限:前提不满足会漏解;高维网格爆炸。
- 常见误用:没有证明单调/单峰;容差小却模型离散误差更大。
- 论文出处:2023-A0127/A0165/A092、2024-A016/A053/A163/A178/A242、2025-A196
方法 52|牛顿迭代
用局部切线反复逼近方程根或参数最优点。
核心表达:$x_{k+1}=x_k-f(x_k)/f'(x_k)$,必要时加入阻尼并同时检查残差与步长。
- 关键参数:初值、导数、阻尼、终止容差。
- 适用场景:由反射率模型反演外延层厚度/参数。
- 优点:局部收敛快、精度高。
- 局限:初值差或导数近0会发散。
- 常见误用:只有一个初值;未与直接法/其他优化交叉印证。
- 论文出处:2025-B060
方法 53|插值与三次样条
在离散观测点之间构造连续曲线;样条用分段三次多项式保持平滑。
核心表达:分段使用三次多项式,节点处保持函数及一、二阶导数连续,并指定端点边界条件。
- 关键参数:节点、边界条件、是否外推。
- 适用场景:提取光谱波谷、重采样、海底曲面连续化。
- 优点:平滑、局部、数值稳定。
- 局限:不代表真实机理;外推危险。
- 常见误用:插值后把新增点当独立观测;过度平滑峰谷。
- 论文出处:2023-B477、2025-B060/B157
A.10 信号处理
方法 54|傅里叶/滑窗傅里叶变换
把波数域光谱分解为频率成分;滑窗版本观察局部频率与信噪比。
核心表达:$X_k=\sum_{n=0}^{N-1}x_n e^{-\mathrm{i}2\pi kn/N}$;STFT 对加窗后的局部信号逐段做变换,FFT 是快速计算离散傅里叶变换的算法。
- 关键参数:窗长、窗函数、重叠、频率分辨率、有效频段。
- 适用场景:干涉条纹周期估计、筛选高信噪比频段。
- 优点:能直接连接周期与厚度。
- 局限:非平稳、趋势和不等距采样会泄漏。
- 常见误用:未等距重采样就FFT;挑频段后仍在同数据上宣称无偏验证。
- 论文出处:2025-B157
方法 55|AsLS基线校正与Savitzky–Golay平滑
AsLS用非对称权重拟合慢变基线;SG在滑窗内做低阶多项式拟合保留峰形。
核心表达:AsLS 交替更新非对称权重并最小化 $\sum_iw_i(y_i-z_i)^2+\lambda\sum_i(\Delta^2z_i)^2$;SG 在滑动窗口内拟合低阶多项式。
- 关键参数:AsLS λ与不对称p;SG窗长与多项式阶数。
- 适用场景:光谱去趋势、去噪且需保留干涉条纹。
- 优点:基线与高频噪声可分开处理。
- 局限:参数不当会削弱真实峰谷。
- 常见误用:先看答案再调窗;不比较处理前后峰位偏移。
- 论文出处:2025-B157
方法 56|带通滤波
只保留目标频率范围,抑制低频趋势和高频噪声。
核心表达:$Y(f)=H(f)X(f)$,通带保留目标频率,阻带衰减其他成分;实际滤波还需考虑过渡带和相位响应。
- 关键参数:上下截止、阶数、相位响应。
- 适用场景:去除非目标干涉成分、强化条纹。
- 优点:实现成熟、频段含义清楚。
- 局限:会产生边缘/振铃与相位偏差。
- 常见误用:滤波后厚度更“漂亮”就认定正确;未说明零相位处理。
- 论文出处:2025-B157
A.11 光学与几何机理
方法 57|光学机理:Fresnel/Snell、Drude/Cauchy与Airy
由折射、界面反射、色散和多光束叠加建立“厚度→反射谱”的可计算前向模型。
核心表达:Snell 定律 $n_1\sin\theta_1=n_2\sin\theta_2$;结合 Fresnel 界面反射、Drude/Cauchy 色散与 Airy 多光束叠加构造前向反射谱。
- 关键参数:折射率/色散参数、入射角、厚度、界面反射率、相干条件。
- 适用场景:红外干涉测外延层厚度。
- 优点:物理可解释、可跨角度联合拟合。
- 局限:模型误设会形成系统误差;参数可辨识性有限。
- 常见误用:把拟合好等同机理正确;双光束/多光束选择无判据。
- 论文出处:2025-B060/B157
方法 58|几何、向量与坐标变换机理建模
把运动、反射、覆盖、碰撞转成坐标、向量、距离和交点计算。
核心表达:用旋转矩阵、点积与叉积、直线与平面求交、距离关系和三角定理,将空间机制转为可计算表达。
- 关键参数:坐标系、方向约定、离散步长、几何容差。
- 适用场景:定日镜、多波束、板凳龙、烟幕遮蔽。
- 优点:机制清晰、可检验、对小数据友好。
- 局限:推导易出现坐标/角度符号错误;现实扰动常被忽略。
- 常见误用:只给公式不做极端情形/量纲检查。
- 论文出处:2023-A/B、2024-A、2025-A
方法 59|栅格化、离散射线与碰撞检测
把连续镜面/光锥/圆周离散为点;用无效点、分离轴、点线距离或点在三角形内判碰。
核心表达:等权采样下,效率可近似为有效采样点数与总采样点数之比;分离轴定理通过投影区间是否分离判断凸形体是否相交。
- 关键参数:网格/圆周点数、时间步长、容差、候选邻域。
- 适用场景:遮挡效率、截断效率、板凳碰撞、烟幕遮蔽。
- 优点:把复杂几何变成可靠程序判定。
- 局限:存在离散误差,细化会急增计算量。
- 常见误用:只报高精度小数不做网格收敛;漏掉边界相切情形。
- 论文出处:2023-A0127/A0165/A0175、2024-A、2025-A196
附录 B:25 类数据预处理手段
**预处理会改变模型能够看到的信息。**删除、填充、聚合和缩放,都应说明业务含义、参数来源及其对结论的影响。下列做法来自特定论文;例如成分和阈值、供应商数量、裁剪波数和孕妇数量,都是案例信息,不是可直接套用的通用规则。
B.1 表连接与重塑
- 论文中的做法:按单品编码自然连接多个附件;数据透视生成日销售矩阵。
- 目的:统一实体主键与时间口径,便于品类/单品分析。
- 风险与改进:连接前查一对一/一对多,否则会重复计数。
- 论文出处:2023-C126/C228
B.2 时间字段解析与多粒度聚合
- 论文中的做法:时间序列化,按日/周/月/年聚合;构造同期平均年。
- 目的:识别短期、季节和年度规律,降低MCMC规模。
- 风险与改进:聚合会丢失日内波动;同期平均可能抹掉趋势与结构变化。
- 论文出处:2023-C126/C228
B.3 类别编码
- 论文中的做法:对定性类别量化或One-hot编码。
- 目的:让回归、距离或相关分析可计算。
- 风险与改进:无序类别不可随意编码成1/2/3,否则制造伪距离。
- 论文出处:2021-B050、2022-C155、2023-C228
B.4 缺失值:众数/热卡/拟合填充
- 论文中的做法:颜色用众数或热卡插补;个别BMI用拟合值填充。
- 目的:保留样本量并利用相似记录信息。
- 风险与改进:插补模型必须只在训练折拟合;单次插补低估不确定性。
- 论文出处:2022-C229、2025-C132
B.5 成分零值乘法替换
- 论文中的做法:对未检出/0成分用小正值按比例替换,再封闭到总和1。
- 目的:使CLR/Dirichlet等方法可用。
- 风险与改进:结构性0与检测限0要区分;替换量会影响稀有成分。
- 论文出处:2022-C229
B.6 无效成分样本剔除
- 论文中的做法:化学成分合计不在85%–105%的样本判无效并删除。
- 目的:排除明显测量/录入异常。
- 风险与改进:阈值来自题意可接受;仍应报告被删样本与敏感性。
- 论文出处:2022-C155
B.7 成分封闭与CLR
- 论文中的做法:将化学成分归一为总和100%,再中心化对数比变换。
- 目的:处理组成数据的定和约束和伪相关。
- 风险与改进:CLR不能直接处理0,解释应回到相对比例。
- 论文出处:2022-C155/C229
B.8 退货/负价记录处理
- 论文中的做法:把负销售单价的退货记录识别为无效销量并剔除。
- 目的:避免把退货当正常负销量扭曲分布。
- 风险与改进:若研究净销售与退货行为,删除会丢信息,宜另设退货变量。
- 论文出处:2023-C050
B.9 利润异常与无关滞销单品清洗
- 论文中的做法:按业务规则清除利润异常值和与目标无关的滞销单品。
- 目的:减少脏数据与无关候选对优化的干扰。
- 风险与改进:规则必须透明;滞销可能是需求尾部而非错误。
- 论文出处:2023-C228
B.10 供应商低质量样本过滤
- 论文中的做法:比较订货与供货偏差,删除供货质量极低的33家。
- 目的:让后续评价聚焦可用供应商。
- 风险与改进:如果目标是风险管理,低质量供应商应作为风险而非直接消失。
- 论文出处:2021-C066
B.11 非线性项与交互项构造
- 论文中的做法:构造平方/非线性变量及交互项,再归一化。
- 目的:让线性框架表达曲率和协同效应。
- 风险与改进:先验层级原则;变量选择与评估要分离。
- 论文出处:2021-B050
B.12 标准化/归一化
- 论文中的做法:连续变量做Z-score或尺度归一;身高体重标准化。
- 目的:消除量纲,稳定距离、神经网络和正则化。
- 风险与改进:树模型通常不需要;标准化参数仅由训练集估计。
- 论文出处:2021-B050、2025-C132
B.13 空间/时间离散化
- 论文中的做法:镜面、锥形光束、圆周、时间离散为采样点。
- 目的:把连续积分和几何判定转成有限计算。
- 风险与改进:必须做步长/点数收敛与边界敏感性。
- 论文出处:2023-A系列、2024-A系列、2025-A196
B.14 插值拟合海底地形
- 论文中的做法:把离散测深转为连续曲面/坡面,并用随机森林辅助分析。
- 目的:允许任意位置估计深度和梯度。
- 风险与改进:插值不确定性应传播到测线优化;避免把预测面当真值。
- 论文出处:2023-B477
B.15 价格区间取均值
- 论文中的做法:将农作物销售价格区间用端点平均作为单值价格。
- 目的:把区间数据转成确定规划参数。
- 风险与改进:均值不是实际成交分布;应以情景/区间敏感性补充。
- 论文出处:2024-C063
B.16 统一表格格式与三维数组
- 论文中的做法:统一附件字段,生成作物×地块×时间的成本/产量张量。
- 目的:便于规划变量索引和约束自动生成。
- 风险与改进:需验证单位、季次、地块类型映射。
- 论文出处:2024-C094
B.17 随机扰动/情景数据生成
- 论文中的做法:用均匀、正态或灾害因子生成销量、产量、成本、价格场景。
- 目的:将确定模型扩展为风险/随机规划。
- 风险与改进:变量间相关必须保留;分布选择要有题意或证据。
- 论文出处:2024-C038/C063/C094/C234
B.18 光谱等间距重采样
- 论文中的做法:以原始波数间距中位数为步长线性插值到等距网格。
- 目的:满足FFT与滑窗频域分析要求。
- 风险与改进:插值会引入相关性;报告网格与原始分辨率。
- 论文出处:2025-B157
B.19 光谱裁剪与有效频段选择
- 论文中的做法:删除约 $1000,\mathrm{cm}^{-1}$ 以下的干扰区,并用滑窗傅里叶变换与信噪比(SNR)选择工作频段。
- 目的:减少非稳定干扰,提高厚度反演信噪比。
- 风险与改进:频段若用拟合结果反向挑选会产生选择偏差。
- 论文出处:2025-B157
B.20 光谱去基线/去趋势
- 论文中的做法:AsLS或低阶多项式估计慢变基线并相减。
- 目的:分离干涉振荡与仪器/背景趋势。
- 风险与改进:基线过强会吞掉真实低频结构。
- 论文出处:2025-B157
B.21 光谱平滑去噪
- 论文中的做法:Savitzky–Golay平滑,必要时带通滤波。
- 目的:降低高频噪声同时尽量保持峰位和峰形。
- 风险与改进:需报告窗长、阶数、截止频率及峰位偏差。
- 论文出处:2025-B157
B.22 比例变量logit变换
- 论文中的做法:对0–1范围的胎儿分数FF做logit变换。
- 目的:解除边界、改善线性与方差稳定性。
- 风险与改进:0或1需修正;反变换后的效应是非线性的。
- 论文出处:2025-C023
B.23 按孕妇聚合与重复测量识别
- 论文中的做法:由记录聚合成267位孕妇,并保留个体层级/时序。
- 目的:避免把重复检测误当独立样本。
- 风险与改进:聚合不能丢掉随孕周变化;训练测试必须按孕妇划分。
- 论文出处:2025-C132
B.24 结构性缺失识别
- 论文中的做法:女胎没有Y染色体指标视为生物结构差异而非普通缺失。
- 目的:防止用插补伪造不存在的生物特征。
- 风险与改进:需在模型中显式分组或移除该类特征。
- 论文出处:2025-C132
B.25 孕周分层、Z值标准化与一致性聚合
- 论文中的做法:按孕周建立零分布,标准化染色体指标,结合ChrX质控和多次结果。
- 目的:降低批次/孕周效应并形成三级判定。
- 风险与改进:分层样本量不足会使均值方差不稳;需FDR和外部验证。
- 论文出处:2025-C023
B.26 预处理复核清单
- 建立数据字典,写明变量、单位、口径、主键和时间范围。
- 检查表连接是一对一、一对多还是多对多,复核连接后的行数与总量。
- 区分普通缺失、系统性缺失与结构性不存在,不对不存在的特征强行插补。
- 对异常值先做业务核查,再比较保留、稳健处理与删除后的结果。
- 插补、标准化、降维和特征筛选均只在训练数据内拟合,再应用到验证数据。
- 时间序列按时间验证,重复记录按对象分组,避免信息跨越训练与测试边界。
- 记录所有阈值、窗口、变换及随机种子,使处理过程可复现。
- 对优化输入做单位、边界、可行性与守恒检查,并评估参数不确定性。
附录 C:31 篇论文的方法与预处理反查
以下按手册编号列出各篇的主要方法及预处理,题目名称使用便于阅读的简称。此处保留“程序迭代”“实验设计”等论文线索,因此与附录 A 的条目不是一一对应关系。列出一种方法,只说明手册记录了它的使用,不代表已经复核其全部实现或验证质量。
C.1 2021 年:2 篇
| 论文编号与题目 | 主要算法与模型 | 预处理与特征工程 |
|---|---|---|
| 2021-B050 · 乙醇偶合制备 C4 烯烃 | 曲线拟合;逐步/多元回归;PCA;BP 网络;欧氏距离实验设计 | 归一化;非线性项与交互项构造 |
| 2021-C066 · 原材料订购与运输 | TOPSIS;多目标/动态规划;遗传算法;程序迭代 | 一致性检查;过滤 33 家极低质量供应商;指标构造 |
C.2 2022 年:2 篇
| 论文编号与题目 | 主要算法与模型 | 预处理与特征工程 |
|---|---|---|
| 2022-C155 · 古代玻璃成分 | CLR;卡方/Yates;回归;决策树/GBDT;R/Q 聚类;灰色关联 | 剔除成分总和不合格样本;成分封闭;类别量化;CLR |
| 2022-C229 · 古代玻璃成分 | Spearman/卡方;Dirichlet 回归;决策树;PLS-DA/PLS;K-means;Pearson/Wilcoxon | 众数与热卡插补;零值乘法替换;成分封闭与 CLR |
C.3 2023 年:10 篇
| 论文编号与题目 | 主要算法与模型 | 预处理与特征工程 |
|---|---|---|
| 2023-A0127 · 定日镜场 | 坐标变换;离散射线/无效点;变步长;二分;单目标优化 | 镜面与锥形光线离散化;分区同心圆降维 |
| 2023-A0165 · 定日镜场 | 空间向量;栅格化;三分;蒙特卡洛;单目标优化 | 镜面栅格化;固定变量降维 |
| 2023-A0175 · 定日镜场 | 坐标旋转;锥形光束;蜂窝排列;蒙特卡洛抽样;遍历 | 光束/镜面网格化;随机抽样 |
| 2023-A092 · 定日镜场 | 投影法;蒙特卡洛;遗传算法;变步长遍历 | 同心圆参数化降维;抽样计算截断效率 |
| 2023-B226 · 多波束测线 | 几何/向量;最小二乘;贪心;模拟退火;PSO | 等深线分区;坡面拟合;差区再细分 |
| 2023-B311 · 多波束测线 | 几何;递推;多目标主要目标法 | 确定等深线方向;递推生成测线 |
| 2023-B477 · 多波束测线 | 几何;贪心;微分;随机森林;改进 MFO | 插值拟合连续曲面;区域分块 |
| 2023-C050 · 蔬菜定价补货 | 描述统计;Spearman/Pearson;K-means++;回归;时间序列;SA;灰色关联 | 剔除负价退货;筛选季度/节气/节日特征 |
| 2023-C126 · 蔬菜定价补货 | Shapiro-Wilk;贝叶斯/MCMC;VAR;优化 | 数据透视生成日销量;同期平均;频率筛选单品 |
| 2023-C228 · 蔬菜定价补货 | ACF/分解;偏相关;FP-Growth;双对数弹性;LSTM;GBest-PSO;NSGA-II | 自然连接;One-hot;多粒度聚合;异常/滞销清洗 |
C.4 2024 年:12 篇
| 论文编号与题目 | 主要算法与模型 | 预处理与特征工程 |
|---|---|---|
| 2024-A016 · 板凳龙 | 等距螺线;积分;逐步逼近;碰撞检测;矩阵比例 | 连续运动按时间/螺距步长数值化 |
| 2024-A053 · 板凳龙 | 阿基米德螺线;递推;分离轴;变步长;PSO | 时间离散;碰撞候选范围缩减 |
| 2024-A163 · 板凳龙 | 极坐标积分;位置/速度递推;十进制逼近;判断函数 | 分段路径与七种位置情形 |
| 2024-A178 · 板凳龙 | 微元/微分方程;数值解;叉乘碰撞;二分;仿真 | 同心圆近似粗定位;局部变步长精搜 |
| 2024-A242 · 板凳龙 | 微积分;二分;动态搜索;PSO;三分 | 缩小碰撞邻域;粗到细搜索 |
| 2024-B159 · 生产决策 | 假设检验;二项分布;期望利润;状态决策;动态规划;Beta 贝叶斯 | 生产流程状态化;记忆化存储 |
| 2024-B195 · 生产决策 | 抽样验收;期望利润;多阶段决策;模拟退火;贝叶斯更新 | 决策转为 0-1 变量;模拟次品数据 |
| 2024-B196 · 生产决策 | 正态近似/t 检验;决策树;蒙特卡洛;ACO;GA;3σ | 0/1 标记合格/次品;随机路径模拟 |
| 2024-C038 · 农作物种植 | MILP;DEGA;CVaR;Spearman;鲁棒/敏感性 | 可视化;二元变量;不确定场景 |
| 2024-C063 · 农作物种植 | 规划求解;随机优化;乐观/期望准则;风险矩阵 | 耕地整理;价格区间取均值;均匀/正态抽样 |
| 2024-C094 · 农作物种植 | 线性规划;贪心;蒙特卡洛;随机规划;软约束 | 统一格式;成本/产量三维表;随机扰动 |
| 2024-C234 · 农作物种植 | 线性规划;GA;均匀分布;风险波动;供需关系 | 灾害因子与不确定因子修正产量/价格 |
C.5 2025 年:5 篇
| 论文编号与题目 | 主要算法与模型 | 预处理与特征工程 |
|---|---|---|
| 2025-A196 · 烟幕投放 | 运动学/几何;布尔积分;二分;多起点变步长;PSO;DE;分层优化 | 圆周离散与点数敏感性;预测遮蔽点降维 |
| 2025-B060 · 外延层厚度 | Drude/Fresnel 双光束;波谷周期;三次样条;Newton 反演;多光束检验 | 样条提取波谷;多方法交叉印证 |
| 2025-B157 · 外延层厚度 | Snell/Fresnel;Cauchy/Airy;FFT/STFT;非线性最小二乘;SGD | 等距重采样;裁频段;AsLS;SG;带通 |
| 2025-C023 · NIPT | LMM;logit;LR 检验;动态规划;Z 判定;FDR | 孕周分层;Z 标准化;ChrX 质控;一致性聚合 |
| 2025-C132 · NIPT | Pearson;LMM/REML;GPR;GA;DeepHit/MLP/LSTM;LightGBM/Optuna/Stacking | 按孕妇聚合;拟合填缺;Z-score;结构性缺失识别##资料来源与使用边界本文正文的经验总结、方法族频次、篇幅比例与措辞统计,整理自原稿《对于数学建模国赛展示论文的研究》。附录 A—C 整理自《2021—2025 本科数学建模国赛官方展示论文:算法与数据预处理学习手册》(整理日期:2026-08-31)。该手册为研究整理材料,本文所称“官方展示”指其收录的论文来源,不表示手册本身由赛事官方编写。手册共 29 个 PDF 页面;以下定位采用页面上印刷的页码,不含封面: |
祝看到这的人比赛顺利。