2026-09-04 更新于 2026-09-07

对于数学建模国赛展示论文的研究

关于数学建模竞赛的延申。

对于数学建模国赛展示论文的研究

本文基于 2021—2025 年本科数学建模国赛的 31 篇官方展示论文整理材料,归纳方法选型、篇幅安排和数学表达中可以复用的经验。正文侧重“怎样建模、怎样写清楚”,附录提供方法与预处理清单,供学习和查阅。

阅读范围:方法样本共 31 篇,其中 2021 年 2 篇、2022 年 2 篇、2023 年 10 篇、2024 年 12 篇、2025 年 5 篇。篇幅分析另取 8 篇、合计 348 页,不能与 31 篇方法样本混为同一统计。本文讨论的是所收集的展示论文,不代表全部参赛论文,也不将展示资格视为所有方法均正确的保证。

一、结论如下

  1. 优秀论文的算法不是按新颖度选择,而是按问题结构分工。 机理模型负责定义对象,统计模型负责识别关系和不确定性,优化算法负责在明确目标与约束下搜索;三者不能互相替代。
  2. 最稳定的写法是“基础模型 → 必要改进 → 独立验证”。 直接堆叠多个高级算法而没有基线模型、消融实验或外样本检验,会使读者难以判断改进是否有效。
  3. 正文的主要篇幅应留给模型建立、求解和结果解释。 摘要、重述、假设、符号说明应短;附录可以很长,但不应反过来替正文承担变量定义、参数来源和验证。
  4. 数学严谨性主要体现为限定,而不是堆叠术语密度。 严谨的句子会交代对象、条件、参数来源、推导关系、误差和结论边界;“显然合理”“效果很好”则是明显的严谨性不足。
  5. 竞赛论文的完整证据闭环是“假设—模型—参数—求解—验证—结论”。 任何一环只给名称而不给证据,后面的精确小数都可能只是计算精细,而非认识可靠。

二、方法选择

2.1 样本中的方法分布

下表是基于原稿的统计,按“出现于多少篇论文”计数;类别会重叠,一篇论文可以同时属于多类。

方法族 涉及论文数 应解决的核心问题
机理、几何与物理建模 15 把物理过程、空间关系或运动过程写成可计算量
数学规划 7 在目标、资源、逻辑和容量约束下给出决策
元启发式优化 14 处理非凸、离散、黑箱或难以精确求解的搜索
数值搜索与求解 10 求根、临界点、反演参数或近似积分
蒙特卡洛与不确定场景 7 近似复杂概率/几何量或传播不确定性
回归与统计推断 12 解释关系、估计效应、检验差异与预测
降维、聚类与综合评价 6 压缩变量、发现分组或形成排序
树模型与神经网络 7 拟合复杂非线性或高阶交互
时间序列与频域分析 4 处理时间依赖、周期和频率结构

2.2 四条可复用的选型逻辑

先定义可计算的量,再优化

定日镜、测线、板凳龙、烟幕和薄膜干涉题都先回答“效率、覆盖、位置、遮蔽或厚度到底如何计算”,随后再使用二分、PSO、DE、GA 等搜索。若判定函数本身错了,优化器只会更快地找到错误模型的最优解。

通过数据结构决定统计模型

  • 组成比例有定和约束:考虑 CLR 变换或 Dirichlet 回归,处理零值和成分间约束。
  • 同一对象多次测量:考虑线性混合效应模型(LMM)等方法,显式处理组内相关。
  • 销量具有时间依赖:用 ACF 诊断、VAR 等模型描述,并按时间切分训练与验证数据。
  • 任务关注事件发生时间:考虑生存模型;存在删失时,必须在建模和评估中处理。DeepHit 是其中一种深度学习方案。

将预测与决策分层

蔬菜补货、种植与生产决策论文通常先估计销量、产量、次品率或价格,再进入规划。预测误差必须传递到决策层;只报告预测精度而不做决策敏感性,闭环的链路仍不完整。

用基线说明复杂算法的必要性

稳健的链条是:解析/线性/贪心基线 → 识别基线失败原因 → 加入非线性、随机性或全局搜索 → 与基线比较。复杂算法的必要性应来自“哪一条假设被放宽”,而不是“该算法更高级”。

2.3 选算法前的问题

  1. 对象:模型处理的是连续量、类别、序列、组成比例、重复测量、图还是空间几何?
  2. 任务:要解释、预测、分类、评价、优化,还是检验差异?不要用预测模型冒充因果解释。
  3. 假设:独立、线性、正态、平稳、凸性、闭合性等前提是否成立?
  4. 规模:样本量和决策维数是否支持该复杂度?可精确求解时为何要用元启发式?
  5. 验证:用什么独立证据证明模型和算法都不是只在当前样本上“自洽”?

2.4 选算法后的验证

在论文写作前,自我质证是一个十分重要的过程。 建完模型的那一刻,须立刻切换成评委角色,像攻击对手一样攻击自己的模型——每个假设、每个参数、每个数字,都问一句凭什么,然后当场给出证据。核心工具就是把质疑 → 证据做成一张表。

每个质疑,必须对应一种可计算的证据,而不是口头解释:

靶心 质疑 对应的证据长什么样
假设 过原点成立吗? 截距显著性检验——截距不显著 → 过原点合理,有据可依
假设 线性成立吗? 残差分析——残差随机分布无趋势 → 线性假设成立
假设 等权合理吗? 与 AHP/熵权结果对比——若排序几乎不变 → 等权作为基线可接受
参数 参数从哪来? 参数来源表——数值、单位、出处(题目/文献/假设)逐项列清
参数 参数靠谱吗? 灵敏度分析——参数 ±10%,结论变化 <5% → 结论稳健
结论 这个数算对了吗? 独立验证——合成数据回测 / 替代算法交叉印证 / 解析特例手工核对
结论 优化真的有效吗? 消融对比表——baseline vs 改进,指标提升 + 代价逐行列清

证据必须是算出来的,不是说出来的。例如说过原点合理没用,须先算出截距 p 值 = 0.83,不显著,故合理——也就是把证据摆进论文。

正确的节奏是:靶心在哪,证据就打在哪。 一个问题里最重要的那个假设,值得花半页做假设检验;无关紧要的边角,一句「此处取默认值」带过即可。证据的密度要跟着风险走,不是均匀铺开。

三、篇幅与行文

3.1 篇幅分布

本节的篇幅统计覆盖 8 篇论文、合计 348 页。表中分别以全部 PDF 页数和剔除参考文献:

部分 占全部 PDF 页 剔除参考文献/附录后的占比
摘要 2.3% 4.1%
重述/分析/假设/符号 4.0% 7.3%
数据与预处理 2.0% 3.6%
模型建立与求解 44.5% 80.3%
检验/误差/灵敏度 1.7% 3.1%
评价/推广/结论 0.9% 1.6%
参考文献与附录 44.5%

这些比例提示:把主要篇幅用于模型建立、求解与解释,把必要的验证就近放在结论之后。表中“检验/误差/灵敏度”的独立章节占比,不等于全部验证内容的占比;验证可能穿插在模型小节中。

3.2 用信息功能组织模型小节

一个小节建议按照以下顺序推进:

  1. 本节要计算什么;
  2. 为什么现有量不足,需要定义哪些变量;
  3. 基于什么假设建立关系;
  4. 推导目标函数/状态转移/统计模型;
  5. 参数从何而来,如何估计;
  6. 用什么算法求解,停止条件是什么;
  7. 输出什么结果;
  8. 如何检验,误差如何影响结论。

四、数学表达

4.1 严谨措辞

严谨性体现在读者能否追溯一个判断成立的条件。原稿中的措辞统计如下;由于未附完整的检索规则与文本范围,命中数适合作为观察线索,不宜解释为严格的语言学频率结论。

措辞功能 命中次数 每万字符约 真正承担的数学责任
定义与符号边界 110 16.6 说明对象、下标范围、单位与符号意义
推导与依据 60 9.0 把结论接回定理、前式、数据或已知条件
假设与适用条件 21 3.2 限定模型成立的世界,不把简化伪装成事实
约束与取值范围 23 3.5 排除数学上可算但现实中不可行的解
统计检验 15 2.3 交代显著性水平、原假设与证据强度
误差与稳健性 37 5.6 说明结论对噪声、步长、参数和场景是否敏感
审慎结论 40 6.0 区分“观察到、估计、支持”与“证明、因果”
局限与改进 5 0.8 指出模型在哪些条件外可能失效

4.2 常见薄弱表述与建议的修改方式

薄弱写法 问题 修正方式
“显然可得” 省略关键推导 指明依据的公式、定理或给出中间式
“模型效果很好” 无评价指标和基线 报告指标、数据切分、基线和置信区间
“结果符合实际” 没有现实参照物 与题目范围、历史数据、量纲或解析特例对比
“采用某算法进行求解” 没有参数、停止条件和可复现性 给编码、初始化、种群/步长、迭代与停止准则
“证明了A影响B” 相关或预测被写成因果 改为“观察到相关/结果支持”,除非有识别设计
“不拒绝原假设,因此二者相同” 把证据不足写成等价证明 改为“未发现显著差异”,并报告检验功效/样本量
“对数据归一化以提高准确率” 目的含糊且可能泄漏 写清缩放公式,参数仅由训练集估计
“使用多种算法相互验证” 多模型可能共享同一错误假设 说明验证路径为何相对独立

4.3 从具体论文中理解严谨性的差异

  • 2022-C229 在评价部分明确承认 Pearson 相关只能刻画线性关系,而正文未先检验线性前提。这种具体到模型假设的自我批评,比“模型仍有不足”更有信息量。
  • 2022-C155/C229 对成分数据先做闭合与对数比处理,体现了“数据空间决定运算规则”;但卡方检验应明确检查并报告期望频数条件,“不拒绝原假设”也不等于证明独立。
  • 2023-A、2024-A、2025-A 的严谨性主要来自几何对象、坐标系、判定条件与数值精度,而不是统计显著性。不同题型的“严谨”载体不同。
  • 2025-B060/B157 先由光学机理导出可辨识关系,再以波谷、FFT/STFT 和非线性拟合交叉反演;真正关键是多种方法是否共享同一折射率假设,以及预处理是否改变条纹周期。
  • 2025-C023/C132 使用重复测量和生存/集成模型时,训练验证必须按孕妇分组。若同一孕妇记录被随机分到训练与测试,指标再高也不构成可靠证据。

五、落实到写作

5.1 摘要

对每一问用 2—4 句完成:

  1. 任务与困难:本问要估计/分类/优化什么,难点是什么;
  2. 关键处理:数据或变量怎样转换;
  3. 模型与求解:为什么选择该模型,用什么算法求解;
  4. 数字结果与验证:给最关键结果,并说明如何验证。

模范论文常用“针对问题一……首先……随后……最终……”建立问题顺序。可以借用其导航功能,但不能把摘要写成算法名流水账。算法名后至少补一个动作对象,例如“采用二分法搜索首次碰撞时刻”,而非“采用二分法求解”。

5.2 正文

每个核心模型至少形成如下闭环:

变量定义 → 假设 → 关系式 → 参数来源 → 求解器 → 数值结果 → 验证 → 结论边界

可以把它当作审稿时的八格检查表。缺一格并非必然错误,但必须说明为何不需要。例如纯解析推导未必需要训练集,统计预测则必须说明数据切分。

5.3 完稿前的复核

  • 对象一致:题意、符号、代码和结果中的变量含义一致,单位与下标完整。
  • 理由充分:每个复杂方法都说明解决了什么困难,并有可比较的基线。
  • 参数可追溯:阈值、权重、初值和超参数都有来源或选择过程。、
  • 验证匹配任务:时间数据按时间验证,重复测量按对象分组;几何问题检查步长、网格与边界。
  • 结果不过度解释:区分相关与因果、局部解与全局最优、未发现差异与证明等价。
  • 结论能够落地:不仅给数值,还交代可执行方案、适用范围和主要误差来源。

带着这些问题再读展示论文,方法名才会变成可以理解、复现和取舍的工具。下面的附录可作为查阅入口:先定位问题结构,再阅读具体方法,最后用论文编号回到案例。

附录 A:59 类方法详解

本附录依据《2021—2025 本科数学建模国赛官方展示论文:算法与数据预处理学习手册》整理,保留其 59 个方法条目及原编号。为便于检索,将手册分散的两组“回归与预测”合并到同一类别,因此局部编号并非连续。

这里的“方法”包括统计模型、变换、优化算法、数值计算和机理建模,并非 59 个彼此独立的算法。每条“论文出处”均为手册所列示例,不应据此反算正文的方法族频次。公式为便于阅读重新排版的核心表达,不代替完整推导;若涉及具体实现,应回到对应论文核对参数与条件。

手册中的少数概括性说法在整理时作了限定,包括 CLR 的零和约束、VAR 的参数规模、CVaR 的尾部比例、生存分析的适用条件及整数规划的最优性表述;这些属于编辑说明,不表示原论文已经完成了相应检验。

A.1 统计与探索

方法 01|描述统计与可视化

用均值、中位数、标准差、偏度、峰度和图形先摸清尺度、离群、长尾与周期。

核心表达:均值 $\bar{x}=n^{-1}\sum_i x_i$;样本方差 $s^2=(n-1)^{-1}\sum_i(x_i-\bar{x})^2$。偏度和峰度分别刻画分布的不对称性与尾部特征。

  • 关键参数:统计口径、时间粒度、分组层级、是否稳健统计。
  • 适用场景:任何数据题的第一步,尤其销量、成本、产量和实验数据。
  • 优点:解释直接、成本低,可暴露建模假设。
  • 局限:不能说明因果;均值易被极端值拉动。
  • 常见误用:只画图不解释;把偏态分布仍用均值±标准差概括。
  • 论文出处:2023-C050、2023-C228、2024-C038/C063

方法 02|Pearson相关系数

衡量两个连续变量的线性同步程度。

核心表达:$r=\dfrac{\sum_i(x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum_i(x_i-\bar{x})^2\sum_i(y_i-\bar{y})^2}}$。

  • 关键参数:显著性水平α、样本量、是否控制混杂。
  • 适用场景:近似连续、线性、无强离群时。
  • 优点:简单、可检验、便于热力图展示。
  • 局限:只识别线性;离群敏感;相关不等于因果。
  • 常见误用:未看散点图就直接解释;时间序列共同趋势造成伪相关。
  • 论文出处:2022-C229、2023-C050、2025-C132

方法 03|Spearman秩相关

把数值换成秩后计算相关,判断单调关系。

核心表达:$\rho=\operatorname{corr}(\operatorname{rank}X,\operatorname{rank}Y)$。无并列秩时,$\rho=1-\dfrac{6\sum_i d_i^2}{n(n^2-1)}$。

  • 关键参数:并列秩处理、α、样本量。
  • 适用场景:非正态、异常值较多、关系单调但非线性时。
  • 优点:稳健、对量纲不敏感。
  • 局限:仍不能说明因果;非单调关系可能接近0。
  • 常见误用:把ρ当斜率;忽略同一对象重复测量。
  • 论文出处:2022-C229、2023-C050、2024-C038

方法 04|偏相关分析

先剔除控制变量的线性影响,再研究两变量净相关。

核心表达:$r_{xy\cdot z}=\dfrac{r_{xy}-r_{xz}r_{yz}}{\sqrt{(1-r_{xz}^2)(1-r_{yz}^2)}}$,这里给出控制单个变量 $z$ 的情形。

  • 关键参数:控制变量集合、线性假设、样本量。
  • 适用场景:替代/互补分析中需控制价格、季节等混杂时。
  • 优点:比普通相关更接近“净关系”。
  • 局限:漏控或错控变量仍会偏;不等于因果。
  • 常见误用:控制了中介变量后作因果解释。
  • 论文出处:2023-C228

A.2 统计检验

方法 05|Pearson卡方检验与Yates校正

比较列联表的观察频数与独立假设下期望频数。

核心表达:$\chi^2=\sum_i (O_i-E_i)^2/E_i$。Yates 校正用于 $2\times2$ 列联表的连续性修正;不能用它替代对稀疏频数条件的检查。

  • 关键参数:α、自由度、期望频数阈值。
  • 适用场景:两个分类变量是否关联。
  • 优点:实现简单、结论清楚。
  • 局限:小样本期望频数过低时近似失效。
  • 常见误用:期望频数不满足仍硬用卡方;把显著性当效应大小。
  • 论文出处:2022-C155、2022-C229

方法 06|Shapiro–Wilk正态性检验

比较排序样本与正态分布期望顺序统计量的一致性。

核心表达:$W=\dfrac{(\sum_i a_i x_{(i)})^2}{\sum_i(x_i-\bar{x})^2}$,其中 $x_{(i)}$ 为排序后的观测值,$a_i$ 为检验权重。

  • 关键参数:α、样本量、检验对象应是残差还是原值。
  • 适用场景:决定是否采用正态型检验或识别销量非正态。
  • 优点:小中样本检验力较好。
  • 局限:大样本对轻微偏离也显著。
  • 常见误用:检验原始Y非正态就否定线性回归;真正关键常是残差。
  • 论文出处:2023-C126、2025-B157

方法 07|Wilcoxon配对符号秩检验

对配对差值排序,检验差值分布中心是否为0。

核心表达:对非零配对差值的绝对值排序,分别计算正差与负差的秩和,再按检验约定构造统计量。

  • 关键参数:配对方式、α、零差处理。
  • 适用场景:两组相关系数或配对指标不宜假设正态时。
  • 优点:非参数、对异常值较稳健。
  • 局限:检验的是位置差异,信息利用少于参数法。
  • 常见误用:把独立样本当配对样本;只报p值。
  • 论文出处:2022-C229

方法 08|似然比/Wald检验与AIC/BIC

用似然差或系数/标准误检验模型项;AIC/BIC在拟合与复杂度间折中。

核心表达:$LR=2(\ell_1-\ell_0)$;单参数 Wald 统计量 $W=(\hat\beta/\operatorname{SE})^2$;$AIC=2k-2\ell$;$BIC=k\ln n-2\ell$。

  • 关键参数:嵌套关系、自由度、参数数k、样本量n。
  • 适用场景:混合效应模型选项、比较随机效应或非线性项。
  • 优点:适用于复杂概率模型,可进行模型选择。
  • 局限:依赖模型设定;AIC/BIC不是预测准确率。
  • 常见误用:拿非嵌套模型做LR;把AIC下降直接说成提升百分比准确率。
  • 论文出处:2025-C023、2025-C132

方法 09|多重检验FDR控制

在大量同时检验中控制错误发现比例,常用Benjamini–Hochberg。

核心表达:将 $m$ 个 $p$ 值从小到大排序,取满足 $p_{(k)}\le kq/m$ 的最大 $k$,拒绝前 $k$ 个原假设;若不存在则不拒绝。

  • 关键参数:目标FDR q、检验数m、依赖结构。
  • 适用场景:多个染色体/分层Z检验同时判定时。
  • 优点:比Bonferroni有更高检出力。
  • 局限:控制的是期望假发现比例,不保证每次零假阳性。
  • 常见误用:把q值当单个样本出错概率。
  • 论文出处:2025-C023

A.3 回归、降维与结构化数据建模

方法 10|普通/多元最小二乘回归

寻找使残差平方和最小的线性关系。

核心表达:$\min_\beta\sum_i(y_i-x_i^\top\beta)^2$;当 $X$ 满列秩时,$\hat\beta=(X^\top X)^{-1}X^\top y$。

  • 关键参数:变量选择、交互项、残差结构、多重共线性。
  • 适用场景:解释因素影响、建立局部近似、拟合坡面。
  • 优点:可解释、计算快、统计推断成熟。
  • 局限:非线性、异方差、强共线性时易失真。
  • 常见误用:对时间序列忽略自相关;以高R^2代替外样本验证。
  • 论文出处:2021-B050、2023-B226、2023-C050

方法 11|逐步回归

按显著性或信息准则逐项加入/删除变量。

核心表达:按前向、后向或双向规则选择变量,使用显著性阈值或 AIC 等准则决定进入和剔除。

  • 关键参数:进入/剔除阈值、候选变量、交互层级。
  • 适用场景:候选变量较多、需要简化解释模型时。
  • 优点:快速、结果紧凑。
  • 局限:选择不稳定、p值偏乐观、易过拟合。
  • 常见误用:把自动选择当科学发现;不做交叉验证。
  • 论文出处:2021-B050

方法 12|多项式/指数/非线性曲线拟合

用具有领域形状的函数逼近趋势。

核心表达:多项式 $y=\sum_j\beta_jx^j$;指数曲线 $y=ae^{bx}$;非线性最小二乘 $\min_\theta\sum_i e_i(\theta)^2$。

  • 关键参数:阶数、初值、参数边界、损失函数。
  • 适用场景:实验温度效应、光谱物理曲线、局部平滑趋势。
  • 优点:直观、参数可解释。
  • 局限:高阶多项式外推不稳;非线性优化依赖初值。
  • 常见误用:只比较训练R^2;在观测区间外远距离外推。
  • 论文出处:2021-B050、2025-B060/B157

方法 13|主成分分析PCA

把相关变量旋转成少量互不相关、方差最大的主成分。

核心表达:对中心化数据的协方差矩阵作特征分解 $S=V\Lambda V^\top$,沿特征向量计算主成分得分 $z=Xv$。

  • 关键参数:标准化、保留成分数、累计解释率。
  • 适用场景:共线性强、需降维后回归或综合指标时。
  • 优点:降维、去共线性、可视化。
  • 局限:主成分按方差而非预测价值;解释变弱。
  • 常见误用:不同量纲未标准化;仅凭解释率选成分。
  • 论文出处:2021-B050

方法 14|中心化对数比变换CLR

将各成分除以组成向量的几何均值后取对数,使分析转向相对比例;CLR 结果仍位于分量和为零的子空间,并未产生相互独立的普通变量。

核心表达:$\operatorname{clr}(x_i)=\ln[x_i/g(x)]$,其中 $g(x)=(\prod_{j=1}^{D}x_j)^{1/D}$。各变换分量之和为零。

  • 关键参数:零值替换、伪计数、成分封闭范围。
  • 适用场景:比例成分总和约为100%的玻璃化学数据。
  • 优点:避免伪相关,使欧氏方法更合理。
  • 局限:无法直接处理0;变换后协方差奇异。
  • 常见误用:对0直接取对数;把CLR系数当原比例绝对变化。
  • 论文出处:2022-C155、2022-C229

方法 15|Dirichlet回归

直接为总和为1的多维比例向量建模。

核心表达:$Y\sim\operatorname{Dirichlet}(\alpha_1,\ldots,\alpha_D)$。可令 $\alpha_j=\phi\mu_j$,以 $\log(\mu_j/\mu_{\mathrm{ref}})=x^\top\beta_j$ 建模均值比例,并另行指定精度参数 $\phi$。

  • 关键参数:链接函数、参考成分、精度参数、零值处理。
  • 适用场景:同时预测多个化学成分比例。
  • 优点:天然保证预测为正且和为1。
  • 局限:不能含结构性0;方差结构限制较强。
  • 常见误用:先随意填0再拟合;忽略组成部分间约束。
  • 论文出处:2022-C229

方法 16|偏最小二乘/PLS-DA

寻找既解释X又与Y最相关的潜变量;PLS-DA把Y编码为类别。

核心表达:构造潜变量 $t=Xw$,在规范化等约束下寻找与响应协方差较大的方向;PLS-DA 使用类别响应编码。

  • 关键参数:潜变量数、缩放、VIP阈值、交叉验证。
  • 适用场景:小样本、高维、强共线的化学成分分类。
  • 优点:兼顾降维与预测。
  • 局限:易因成分数选择不当过拟合。
  • 常见误用:先用全数据选变量再交叉验证,造成泄漏。
  • 论文出处:2022-C229

方法 17|双对数需求/价格弹性模型

销量与价格同时取对数,价格系数就是弹性。

核心表达:$\ln Q=\alpha+\beta\ln P+\cdots$,模型中的价格弹性为 $\partial\ln Q/\partial\ln P=\beta$。

  • 关键参数:控制变量、零销量处理、内生性、时间固定效应。
  • 适用场景:定价—需求关系与弹性估计。
  • 优点:解释方便、相对变化尺度自然。
  • 局限:价格常与需求同时决定,OLS可能内生偏误。
  • 常见误用:把相关系数或回归β直接当因果弹性。
  • 论文出处:2023-C228

方法 21|贝叶斯模型与MCMC

把未知参数视为随机变量,用先验×似然得到后验,再用马尔可夫链抽样。

核心表达:$p(\theta\mid y)\propto p(y\mid\theta)p(\theta)$;MCMC 用相关抽样近似后验分布及其积分。

  • 关键参数:先验、链数、迭代/燃烧、步长、收敛诊断、MC误差。
  • 适用场景:零膨胀/层级销量、参数不确定性需要完整表达时。
  • 优点:能给区间与概率、可融入先验。
  • 局限:计算慢、对先验和模型设定敏感。
  • 常见误用:只跑一条链;只看轨迹“像稳定”;不报告有效样本量。
  • 论文出处:2023-C126

方法 22|线性混合效应模型LMM/REML

固定效应描述总体规律,随机截距/斜率刻画同一孕妇重复测量和个体差异。

核心表达:$y=X\beta+Zu+\varepsilon$,其中 $u\sim N(0,G)$、$\varepsilon\sim N(0,R)$,通常假设两者独立。

  • 关键参数:固定项、随机效应结构、REML/ML、协方差结构。
  • 适用场景:纵向重复测量、组内相关明显时。
  • 优点:兼顾总体解释与个体异质性。
  • 局限:随机结构复杂时估计不稳;仍依赖分布与线性假设。
  • 常见误用:把同一人的多次检测当独立样本;随机效应结构不检验。
  • 论文出处:2025-C023、2025-C132

方法 23|高斯过程回归GPR

在函数空间设高斯先验,观测后得到任一点的预测分布。

核心表达:$f\sim GP(m,k)$,$y=f(x)+\varepsilon$;核函数 $k$ 决定函数值之间的协方差结构。

  • 关键参数:核函数、长度尺度、噪声方差、均值函数。
  • 适用场景:小中样本、需要非线性预测与不确定区间时。
  • 优点:能够同时给出预测均值与模型假设下的不确定区间。
  • 局限:标准实现O(n^3),高维核选择困难。
  • 常见误用:用后验均值阈值而忽略预测不确定性。
  • 论文出处:2025-C132

方法 24|生存分析与DeepHit

把“首次达到阈值的孕周”视为时间到事件;DeepHit直接预测各离散时点的事件概率。

核心表达:用事件时间的离散概率分布或累计分布描述何时发生事件;DeepHit 的训练目标通常结合似然与排序损失。

  • 关键参数:时间网格、删失定义、网络结构、损失权重。
  • 适用场景:达标时间预测、存在未达标或随访截止时。
  • 优点:正确处理时间与删失;可个体化。
  • 局限:深度模型数据需求大、校准与解释困难。
  • 常见误用:未依据“时间到事件”的任务结构选模;忽略删失或仅报告普通分类准确率。没有删失并不意味着不能使用生存模型。
  • 论文出处:2025-C132

A.4 时间序列

方法 18|ACF与时间序列分解

ACF衡量滞后相关;分解把序列拆成趋势、季节与残差。

核心表达:弱平稳条件下 $\rho(k)=\operatorname{Cov}(y_t,y_{t-k})/\operatorname{Var}(y_t)$;加法分解 $y_t=T_t+S_t+R_t$,乘法分解 $y_t=T_tS_tR_t$。

  • 关键参数:滞后阶、周期、加法/乘法、平滑窗口。
  • 适用场景:销量周期、季节性和趋势诊断。
  • 优点:可解释、帮助选预测结构。
  • 局限:结构变化或缺失会干扰;不是预测模型本身。
  • 常见误用:看见ACF峰就断言因果周期;未去趋势。
  • 论文出处:2023-C228

方法 19|VAR向量自回归

多变量互相用各自和彼此的滞后预测。

核心表达:$y_t=c+A_1y_{t-1}+\cdots+A_py_{t-p}+\varepsilon_t$。若有 $K$ 个变量,滞后系数数量为 $K^2p$。

  • 关键参数:滞后阶p、平稳性、变量数、样本量。
  • 适用场景:多个菜品销量/损耗/次数相互影响的短期预测。
  • 优点:能描述动态交互。
  • 局限:滞后系数数量随变量数平方增长、随滞后阶线性增长;常规平稳 VAR 需检查平稳性,不能忽略共同趋势。
  • 常见误用:小样本塞入过多变量;不做单位根和残差诊断。
  • 论文出处:2023-C126

方法 20|LSTM长短期记忆网络

用门控单元决定保留、遗忘和输出历史信息。

核心表达:$f_t=\sigma(W_f[h_{t-1},x_t]+b_f)$,$c_t=f_t\odot c_{t-1}+i_t\odot\tilde c_t$;门控机制调节记忆的保留与更新。

  • 关键参数:窗口长度、隐藏单元、层数、学习率、dropout、轮数。
  • 适用场景:非线性时序、较长依赖、数据量足够时。
  • 优点:表达能力强、可联合多特征。
  • 局限:数据少时不稳;解释弱;训练和调参成本高。
  • 常见误用:随机切分时间数据;以训练R^2宣称预测可靠。
  • 论文出处:2023-C228、2025-C132

A.5 机器学习

方法 25|BP神经网络/多层感知机

多层非线性映射,用误差反向传播更新权重。

核心表达:按损失函数的梯度更新参数:$W\leftarrow W-\eta,\partial L/\partial W$。

  • 关键参数:隐藏层/神经元、激活函数、学习率、正则化、训练轮数。
  • 适用场景:复杂非线性回归、静态特征融合。
  • 优点:通用逼近能力强。
  • 局限:小样本易过拟合;解释性弱。
  • 常见误用:隐藏单元凭试到最好却不留验证集;输入未缩放。
  • 论文出处:2021-B050、2025-C132

方法 26|决策树

用特征阈值递归切分,使子节点更纯。

核心表达:递归选择使信息增益最大或基尼不纯度下降最大的切分;回归树则按平方误差等准则划分。

  • 关键参数:最大深度、最小叶样本、剪枝、特征候选。
  • 适用场景:规则式分类、需要解释阈值时。
  • 优点:可视化、非线性、无需缩放。
  • 局限:单树高方差,易过拟合。
  • 常见误用:样本很小却得到100%准确率即宣称泛化完美。
  • 论文出处:2022-C155、2022-C229、2024-B196

方法 27|随机森林

对自助样本训练多棵随机子特征树并投票/平均。

核心表达:分类预测为各树投票 $\hat y=\operatorname{mode}{T_b(x)}$;回归预测取各树输出的均值。

  • 关键参数:树数、最大深度、每次候选特征数、叶样本。
  • 适用场景:非线性表格数据、插值拟合、变量重要性。
  • 优点:稳健、少预处理、能拟合交互。
  • 局限:外推差、解释是近似的。
  • 常见误用:把特征重要性当因果;训练测试空间重叠。
  • 论文出处:2023-B477

方法 28|梯度提升树/LightGBM

逐轮拟合当前残差/负梯度;LightGBM以高效直方图和叶优先生长实现。

核心表达:$F_m(x)=F_{m-1}(x)+\eta h_m(x)$,新树拟合当前损失所对应的改进方向。

  • 关键参数:树数、学习率、叶数/深度、采样、正则。
  • 适用场景:结构化数据分类,非线性与交互较多时。
  • 优点:预测强、缺失处理方便。
  • 局限:调参多;小样本很容易过拟合。
  • 常见误用:先用全数据调Optuna再评估;类别极不平衡只看准确率。
  • 论文出处:2022-C155(GBDT)、2025-C132(LightGBM)

方法 29|K-means/K-means++

最小化样本到所属质心的平方距离;++用分散的初始中心改善稳定性。

核心表达:$\min_{{c_i},{\mu_k}}\sum_i\lVert x_i-\mu_{c_i}\rVert_2^2$。K-means++ 改进初始化,并不改变这一目标。

  • 关键参数:K、缩放、初始化、重复次数、距离。
  • 适用场景:按销量特征或玻璃成分做无监督分组。
  • 优点:简单快速、结果直观。
  • 局限:偏好球状、相近大小簇;异常值敏感。
  • 常见误用:不同量纲不标准化;用业务希望的K而无轮廓系数/稳定性。
  • 论文出处:2022-C229、2023-C050

方法 30|R型与Q型聚类

R型聚变量,Q型聚样本;先R后Q可先筛冗余特征再分样本。

核心表达:R 型以变量为聚类对象,Q 型以样本为聚类对象;两者仍需具体指定距离、链接或划分算法。

  • 关键参数:距离、链接方式、簇数、缩放。
  • 适用场景:化学成分变量筛选与玻璃亚类划分。
  • 优点:适合探索变量与样本双重结构。
  • 局限:结果依赖距离与标准化。
  • 常见误用:把聚类标签当真实类别;不做扰动稳定性。
  • 论文出处:2022-C155

方法 31|堆叠集成与Optuna

基模型输出作为元特征,再训练元模型;Optuna用序贯搜索调超参。

核心表达:$\hat y=g(f_1(x),\ldots,f_K(x))$,也可加入原始特征。训练元模型时,基模型预测必须来自折外预测。

  • 关键参数:折数、基模型、元模型、搜索空间、试验次数。
  • 适用场景:基模型误差具有互补性,且数据量允许可靠的折外预测与独立评估时;小样本下尤其需要谨慎。
  • 优点:可融合互补误差。
  • 局限:数据泄漏风险极高;复杂度增加。
  • 常见误用:元特征不是out-of-fold生成;调参和评估共用验证集。
  • 论文出处:2025-C132

A.6 关联规则挖掘

方法 32|FP-Growth关联规则

用FP树压缩事务数据,挖掘频繁项集而无需反复候选生成。

核心表达:$\operatorname{conf}(X\to Y)=\operatorname{supp}(X\cup Y)/\operatorname{supp}(X)$;$\operatorname{lift}(X\to Y)=\operatorname{conf}(X\to Y)/\operatorname{supp}(Y)$。

  • 关键参数:最小支持度、置信度、提升度。
  • 适用场景:购物篮中单品共同出现关系。
  • 优点:比Apriori高效,规则易读。
  • 局限:高频不等于强业务关系;稀有重要组合可能漏掉。
  • 常见误用:只看置信度不看基准概率/提升度。
  • 论文出处:2023-C228

A.7 综合评价与关联度

方法 33|灰色关联分析

比较标准化序列曲线的接近程度。

核心表达:$\xi_i(k)=\dfrac{\Delta_{\min}+\rho\Delta_{\max}}{\Delta_i(k)+\rho\Delta_{\max}}$,再对关联系数加权平均。

  • 关键参数:分辨系数ρ、正向化/归一化、权重。
  • 适用场景:小样本、多指标、缺乏明确分布假设的关联排序。
  • 优点:计算简单、样本要求低。
  • 局限:尺度处理与参考序列主观;不是统计显著性。
  • 常见误用:把关联度称为相关系数或因果效应。
  • 论文出处:2022-C155、2023-C050

方法 34|TOPSIS多指标评价

最佳方案应离正理想解近、离负理想解远。

核心表达:$C_i=D_i^-/(D_i^++D_i^-)$,其中 $D_i^+$、$D_i^-$ 分别为到正、负理想解的距离。

  • 关键参数:指标正向化、标准化、权重、距离度量。
  • 适用场景:供应商综合重要性排序。
  • 优点:透明、便于综合多指标。
  • 局限:权重和补偿性会改变排序。
  • 常见误用:指标重复导致双重计权;排序后不做敏感性分析。
  • 论文出处:2021-C066

A.8 优化与决策

方法 35|线性/0-1/混合整数规划

用线性目标和约束表达资源分配;0-1变量表达是否选择。

核心表达:$\max c^\top x$,满足 $Ax\le b$ 及变量边界;部分变量可要求为整数或 $x_j\in{0,1}$。

  • 关键参数:决策粒度、Big-M、整数变量、约束上下界。
  • 适用场景:种植、订购、运输、检测选择。
  • 优点:目标与约束表达清晰;在满足条件并完成相应求解时,可给出最优性证据或最优性间隙。提前终止的整数规划解不自动等于全局最优。
  • 局限:整数规模大时求解慢;非线性关系需线性化。
  • 常见误用:Big-M过大;把“面积不宜太小”等自然语言漏掉或随意定值。
  • 论文出处:2021-C066、2024-C038/C063/C094

方法 36|非线性规划

目标或约束含非线性,用连续优化器寻找可行极值。

核心表达:$\min_x f(x)$,满足 $g_i(x)\le0$、$h_j(x)=0$ 及变量边界。

  • 关键参数:初值、边界、容差、梯度、约束处理。
  • 适用场景:定价弹性、光学效率、连续运动参数优化。
  • 优点:表达真实关系更自然。
  • 局限:常非凸,可能只得局部最优。
  • 常见误用:只给一个解不说明初值/多起点;把求解器成功当全局最优。
  • 论文出处:2021-B050、2023-C228、2025-A196

方法 37|动态规划与记忆化

把问题拆成有重叠子问题,用状态转移累积最优值。

核心表达:确定性转移下,$V_t(s)=\max_a{r_t(s,a)+V_{t+1}(T_t(s,a))}$;随机转移需对下一状态取条件期望。

  • 关键参数:状态、动作、阶段、边界、离散精度。
  • 适用场景:多阶段检测拆解决策、分段边界与检测时点。
  • 优点:能利用最优子结构,结果可追溯。
  • 局限:状态爆炸;离散会带来近似误差。
  • 常见误用:状态遗漏历史依赖;把贪心递推误称动态规划。
  • 论文出处:2021-C066、2024-B159、2025-C023

方法 38|遗传算法GA

把候选方案编码成染色体,经选择、交叉、变异迭代。

核心表达:候选方案编码 → 适应度评价 → 选择、交叉、变异 → 新种群,反复迭代并检查可行性。

  • 关键参数:种群、代数、交叉率、变异率、精英数、编码。
  • 适用场景:离散连续混合、非凸、黑箱目标。
  • 优点:适用广、无需梯度。
  • 局限:计算多、无全局最优保证、结果随机。
  • 常见误用:不报告随机种子和重复稳定性;罚函数尺度失衡。
  • 论文出处:2021-C066、2023-A092、2024-B196/C234、2025-C132

方法 39|差分进化DE与DEGA

DE用个体差向量生成变异;DEGA把差分变异融入GA提升搜索。

核心表达:典型变异式为 $v_i=x_{r_1}+F(x_{r_2}-x_{r_3})$,再进行交叉和选择。

  • 关键参数:缩放因子F、交叉率CR、种群、边界修复。
  • 适用场景:连续高维、非凸,或希望增强GA局部/全局平衡。
  • 优点:参数少、连续优化常有效。
  • 局限:离散约束需专门编码;仍是随机近似。
  • 常见误用:把一次更优结果当算法必然优越。
  • 论文出处:2024-C038(DEGA)、2025-A196(DE)

方法 40|粒子群PSO/GBest-PSO

粒子由自身最好与群体最好位置共同牵引。

核心表达:$v_i\leftarrow\omega v_i+c_1r_1(p_i^{\mathrm{best}}-x_i)+c_2r_2(g^{\mathrm{best}}-x_i)$,随后更新 $x_i\leftarrow x_i+v_i$。

  • 关键参数:ω、c_1、c_2、粒子数、迭代、速度/边界。
  • 适用场景:连续黑箱、多峰优化;定价、螺距、拟合。
  • 优点:实现简洁、收敛快。
  • 局限:易早熟,处理复杂离散约束困难。
  • 常见误用:无约束修复;只与“平均方案”比较而不与强基线比较。
  • 论文出处:2023-B226、2023-C228、2024-A053/A242、2025-A196

方法 41|模拟退火SA

允许以随温度下降的概率接受劣解,以跳出局部最优。

核心表达:最小化问题中,若目标恶化量为 $\Delta>0$,以 $\exp(-\Delta/T)$ 的概率接受劣解。

  • 关键参数:初温、降温率、马尔可夫链长度、终温、邻域。
  • 适用场景:组合路径、补货定价、多峰优化。
  • 优点:机制直观、可跳出局部最优。
  • 局限:参数敏感、慢、单次结果波动。
  • 常见误用:降温过快退化成贪心;无多次运行统计。
  • 论文出处:2023-B226、2023-C050、2024-B195

方法 42|贪心算法

每一步选当前最有利动作,希望构成好解。

核心表达:按局部评价规则选择当前动作,立即更新剩余资源与可行域,直至构造完整方案。

  • 关键参数:排序指标、破局规则、回溯/修复。
  • 适用场景:测线逐条布设、快速种植基线。
  • 优点:快、易解释、适合做基准。
  • 局限:一般不保证全局最优。
  • 常见误用:没有交换论证却称最优;忽略早期选择锁死后续。
  • 论文出处:2023-B226/B477、2024-C094

方法 43|多目标规划、主要目标法与Pareto

同时处理收益、需求、漏测等冲突目标;Pareto解不能在不牺牲其他目标下继续改进。

核心表达:同时考虑 $[f_1(x),\ldots,f_m(x)]$。主要目标法优化一个目标,并将其他目标转为带阈值的约束;Pareto 解表示非支配的权衡方案。

  • 关键参数:目标尺度、优先级、ε阈值、决策偏好。
  • 适用场景:收益与需求、长度与漏测/重叠冲突时。
  • 优点:保留权衡信息。
  • 局限:最终选解仍需价值判断。
  • 常见误用:未经标准化直接加权;把某个Pareto点称唯一最优。
  • 论文出处:2021-C066、2023-B311、2023-C228

方法 44|NSGA-II与混合编码/约束违反CV

按非支配等级和拥挤距离选择,维持Pareto前沿多样性;混合编码同时表示二元与实数变量。

核心表达:以快速非支配排序和拥挤距离维护解集;约束违反量 CV 汇总不可行程度,混合编码分别表示离散与连续变量。

  • 关键参数:种群、代数、交叉/变异、编码、CV尺度。
  • 适用场景:单品选择(二元)+补货定价(连续)的多目标问题。
  • 优点:一次得到多种权衡方案。
  • 局限:计算昂贵、约束与编码设计复杂。
  • 常见误用:论文OCR把NSGA-II误成III需回看原文;只展示漂亮前沿不检验可行性。
  • 论文出处:2023-C228

方法 45|蚁群算法ACO

人工蚂蚁按信息素与启发值构造路径,优质路径增强信息素。

核心表达:$P_{ij}\propto\tau_{ij}^{\alpha}\eta_{ij}^{\beta}$;$\tau_{ij}\leftarrow(1-\rho)\tau_{ij}+\Delta\tau_{ij}$。概率还需在可行动作集合内归一化。

  • 关键参数:蚂蚁数、α、β、挥发率ρ、迭代。
  • 适用场景:离散决策路径、组合优化。
  • 优点:正反馈、便于编码路径。
  • 局限:易早熟、参数多。
  • 常见误用:用在很小枚举空间反而复杂;不与穷举核对。
  • 论文出处:2024-B196

方法 46|飞蛾火焰算法MFO

候选解沿对数螺旋向精英“火焰”移动。

核心表达:$M_i\leftarrow S(M_i,F_j)$,其中 $S$ 表示围绕精英位置 $F_j$ 的螺旋更新规则。

  • 关键参数:种群、火焰数、螺旋参数、迭代、边界。
  • 适用场景:连续路径搜索或复杂黑箱优化。
  • 优点:结构简单、探索性较强。
  • 局限:理论与稳定性弱于成熟优化器,易被包装性使用。
  • 常见误用:“改进”只改名字/参数却无消融实验。
  • 论文出处:2023-B477

方法 47|随机规划、场景模拟与蒙特卡洛

从不确定分布抽取场景,在多种未来下比较期望收益和风险。

核心表达:$\max_x\mathbb E_\xi[f(x,\xi)]\approx\max_x N^{-1}\sum_{s=1}^N f(x,\xi_s)$。蒙特卡洛也可独立用于积分、概率或几何量估计。

  • 关键参数:分布、场景数N、相关结构、随机种子。
  • 适用场景:产量、销量、成本、价格波动;光线/镜面抽样。
  • 优点:直观、可兼容复杂模型。
  • 局限:结果依赖分布与场景覆盖;计算成本高。
  • 常见误用:独立抽样破坏变量相关;场景少却声称稳健。
  • 论文出处:2023-A0165/A0175/A092、2024-C063/C094/C234

方法 48|CVaR与鲁棒优化

CVaR 在置信水平 α 下刻画损失分布上尾风险;连续分布时可理解为最差 1−α 比例情形的平均损失。鲁棒优化则针对指定不确定集合求解。

核心表达:$\operatorname{CVaR}\alpha(L)=\min\eta{\eta+\mathbb E[(L-\eta)+]/(1-\alpha)}$,其中 $(u)+=\max(u,0)$。

  • 关键参数:置信水平α、风险权重、不确定集/半径。
  • 适用场景:农业利润既要高又怕极端坏年。
  • 优点:风险含义清楚、能抑制尾部损失。
  • 局限:参数主观且可能保守。
  • 常见误用:把CVaR直接与利润同向相加而符号错误;用敏感性分析冒充鲁棒优化。
  • 论文出处:2024-C038

方法 49|乐观准则与最大期望准则

乐观准则看每方案最好结果;最大期望按场景概率加权。

核心表达:收益矩阵为 $a_{ij}$ 时,乐观准则取 $\max_i\max_j a_{ij}$;最大期望准则取 $\max_i\sum_jp_ja_{ij}$。

  • 关键参数:场景概率、决策者风险偏好。
  • 适用场景:多个候选种植方案在不确定环境下择优。
  • 优点:简单、可解释。
  • 局限:乐观准则风险极高;期望忽略尾部。
  • 常见误用:场景概率由随意频数产生;不报告最坏结果。
  • 论文出处:2024-C063

方法 50|分层优化、任务分配与局部网格

先解离散任务分配,再在低维子问题中优化连续参数,最后局部细搜。

核心表达:任务分配 → 子问题中的连续参数优化 → 局部精细搜索,并复核不同层次之间的耦合约束。

  • 关键参数:分层规则、子问题边界、网格步长、多起点。
  • 适用场景:多无人机、多烟幕、多目标的高维协同。
  • 优点:显著降维、便于解释和实现。
  • 局限:层间耦合被切断,可能错过全局最优。
  • 常见误用:先分配规则未经比较;局部网格范围由结果倒推。
  • 论文出处:2025-A196

A.9 数值求解

方法 51|二分/三分/变步长/多起点搜索

二分求根依赖连续性及根的有效括区间,二分搜索可行边界依赖单调性;三分依赖单峰结构。变步长先粗后细,多起点降低局部解风险。

核心表达:二分逐次折半定位根或单调边界;三分依赖单峰结构;变步长逐级细化;多起点比较不同初始位置的结果。

  • 关键参数:初始区间、单调/单峰证明、容差、步长序列、起点数。
  • 适用场景:碰撞时刻、最小螺距、最大速度、连续参数黑箱。
  • 优点:透明、稳定、易复核。
  • 局限:前提不满足会漏解;高维网格爆炸。
  • 常见误用:没有证明单调/单峰;容差小却模型离散误差更大。
  • 论文出处:2023-A0127/A0165/A092、2024-A016/A053/A163/A178/A242、2025-A196

方法 52|牛顿迭代

用局部切线反复逼近方程根或参数最优点。

核心表达:$x_{k+1}=x_k-f(x_k)/f'(x_k)$,必要时加入阻尼并同时检查残差与步长。

  • 关键参数:初值、导数、阻尼、终止容差。
  • 适用场景:由反射率模型反演外延层厚度/参数。
  • 优点:局部收敛快、精度高。
  • 局限:初值差或导数近0会发散。
  • 常见误用:只有一个初值;未与直接法/其他优化交叉印证。
  • 论文出处:2025-B060

方法 53|插值与三次样条

在离散观测点之间构造连续曲线;样条用分段三次多项式保持平滑。

核心表达:分段使用三次多项式,节点处保持函数及一、二阶导数连续,并指定端点边界条件。

  • 关键参数:节点、边界条件、是否外推。
  • 适用场景:提取光谱波谷、重采样、海底曲面连续化。
  • 优点:平滑、局部、数值稳定。
  • 局限:不代表真实机理;外推危险。
  • 常见误用:插值后把新增点当独立观测;过度平滑峰谷。
  • 论文出处:2023-B477、2025-B060/B157

A.10 信号处理

方法 54|傅里叶/滑窗傅里叶变换

把波数域光谱分解为频率成分;滑窗版本观察局部频率与信噪比。

核心表达:$X_k=\sum_{n=0}^{N-1}x_n e^{-\mathrm{i}2\pi kn/N}$;STFT 对加窗后的局部信号逐段做变换,FFT 是快速计算离散傅里叶变换的算法。

  • 关键参数:窗长、窗函数、重叠、频率分辨率、有效频段。
  • 适用场景:干涉条纹周期估计、筛选高信噪比频段。
  • 优点:能直接连接周期与厚度。
  • 局限:非平稳、趋势和不等距采样会泄漏。
  • 常见误用:未等距重采样就FFT;挑频段后仍在同数据上宣称无偏验证。
  • 论文出处:2025-B157

方法 55|AsLS基线校正与Savitzky–Golay平滑

AsLS用非对称权重拟合慢变基线;SG在滑窗内做低阶多项式拟合保留峰形。

核心表达:AsLS 交替更新非对称权重并最小化 $\sum_iw_i(y_i-z_i)^2+\lambda\sum_i(\Delta^2z_i)^2$;SG 在滑动窗口内拟合低阶多项式。

  • 关键参数:AsLS λ与不对称p;SG窗长与多项式阶数。
  • 适用场景:光谱去趋势、去噪且需保留干涉条纹。
  • 优点:基线与高频噪声可分开处理。
  • 局限:参数不当会削弱真实峰谷。
  • 常见误用:先看答案再调窗;不比较处理前后峰位偏移。
  • 论文出处:2025-B157

方法 56|带通滤波

只保留目标频率范围,抑制低频趋势和高频噪声。

核心表达:$Y(f)=H(f)X(f)$,通带保留目标频率,阻带衰减其他成分;实际滤波还需考虑过渡带和相位响应。

  • 关键参数:上下截止、阶数、相位响应。
  • 适用场景:去除非目标干涉成分、强化条纹。
  • 优点:实现成熟、频段含义清楚。
  • 局限:会产生边缘/振铃与相位偏差。
  • 常见误用:滤波后厚度更“漂亮”就认定正确;未说明零相位处理。
  • 论文出处:2025-B157

A.11 光学与几何机理

方法 57|光学机理:Fresnel/Snell、Drude/Cauchy与Airy

由折射、界面反射、色散和多光束叠加建立“厚度→反射谱”的可计算前向模型。

核心表达:Snell 定律 $n_1\sin\theta_1=n_2\sin\theta_2$;结合 Fresnel 界面反射、Drude/Cauchy 色散与 Airy 多光束叠加构造前向反射谱。

  • 关键参数:折射率/色散参数、入射角、厚度、界面反射率、相干条件。
  • 适用场景:红外干涉测外延层厚度。
  • 优点:物理可解释、可跨角度联合拟合。
  • 局限:模型误设会形成系统误差;参数可辨识性有限。
  • 常见误用:把拟合好等同机理正确;双光束/多光束选择无判据。
  • 论文出处:2025-B060/B157

方法 58|几何、向量与坐标变换机理建模

把运动、反射、覆盖、碰撞转成坐标、向量、距离和交点计算。

核心表达:用旋转矩阵、点积与叉积、直线与平面求交、距离关系和三角定理,将空间机制转为可计算表达。

  • 关键参数:坐标系、方向约定、离散步长、几何容差。
  • 适用场景:定日镜、多波束、板凳龙、烟幕遮蔽。
  • 优点:机制清晰、可检验、对小数据友好。
  • 局限:推导易出现坐标/角度符号错误;现实扰动常被忽略。
  • 常见误用:只给公式不做极端情形/量纲检查。
  • 论文出处:2023-A/B、2024-A、2025-A

方法 59|栅格化、离散射线与碰撞检测

把连续镜面/光锥/圆周离散为点;用无效点、分离轴、点线距离或点在三角形内判碰。

核心表达:等权采样下,效率可近似为有效采样点数与总采样点数之比;分离轴定理通过投影区间是否分离判断凸形体是否相交。

  • 关键参数:网格/圆周点数、时间步长、容差、候选邻域。
  • 适用场景:遮挡效率、截断效率、板凳碰撞、烟幕遮蔽。
  • 优点:把复杂几何变成可靠程序判定。
  • 局限:存在离散误差,细化会急增计算量。
  • 常见误用:只报高精度小数不做网格收敛;漏掉边界相切情形。
  • 论文出处:2023-A0127/A0165/A0175、2024-A、2025-A196

附录 B:25 类数据预处理手段

**预处理会改变模型能够看到的信息。**删除、填充、聚合和缩放,都应说明业务含义、参数来源及其对结论的影响。下列做法来自特定论文;例如成分和阈值、供应商数量、裁剪波数和孕妇数量,都是案例信息,不是可直接套用的通用规则。

B.1 表连接与重塑

  • 论文中的做法:按单品编码自然连接多个附件;数据透视生成日销售矩阵。
  • 目的:统一实体主键与时间口径,便于品类/单品分析。
  • 风险与改进:连接前查一对一/一对多,否则会重复计数。
  • 论文出处:2023-C126/C228

B.2 时间字段解析与多粒度聚合

  • 论文中的做法:时间序列化,按日/周/月/年聚合;构造同期平均年。
  • 目的:识别短期、季节和年度规律,降低MCMC规模。
  • 风险与改进:聚合会丢失日内波动;同期平均可能抹掉趋势与结构变化。
  • 论文出处:2023-C126/C228

B.3 类别编码

  • 论文中的做法:对定性类别量化或One-hot编码。
  • 目的:让回归、距离或相关分析可计算。
  • 风险与改进:无序类别不可随意编码成1/2/3,否则制造伪距离。
  • 论文出处:2021-B050、2022-C155、2023-C228

B.4 缺失值:众数/热卡/拟合填充

  • 论文中的做法:颜色用众数或热卡插补;个别BMI用拟合值填充。
  • 目的:保留样本量并利用相似记录信息。
  • 风险与改进:插补模型必须只在训练折拟合;单次插补低估不确定性。
  • 论文出处:2022-C229、2025-C132

B.5 成分零值乘法替换

  • 论文中的做法:对未检出/0成分用小正值按比例替换,再封闭到总和1。
  • 目的:使CLR/Dirichlet等方法可用。
  • 风险与改进:结构性0与检测限0要区分;替换量会影响稀有成分。
  • 论文出处:2022-C229

B.6 无效成分样本剔除

  • 论文中的做法:化学成分合计不在85%–105%的样本判无效并删除。
  • 目的:排除明显测量/录入异常。
  • 风险与改进:阈值来自题意可接受;仍应报告被删样本与敏感性。
  • 论文出处:2022-C155

B.7 成分封闭与CLR

  • 论文中的做法:将化学成分归一为总和100%,再中心化对数比变换。
  • 目的:处理组成数据的定和约束和伪相关。
  • 风险与改进:CLR不能直接处理0,解释应回到相对比例。
  • 论文出处:2022-C155/C229

B.8 退货/负价记录处理

  • 论文中的做法:把负销售单价的退货记录识别为无效销量并剔除。
  • 目的:避免把退货当正常负销量扭曲分布。
  • 风险与改进:若研究净销售与退货行为,删除会丢信息,宜另设退货变量。
  • 论文出处:2023-C050

B.9 利润异常与无关滞销单品清洗

  • 论文中的做法:按业务规则清除利润异常值和与目标无关的滞销单品。
  • 目的:减少脏数据与无关候选对优化的干扰。
  • 风险与改进:规则必须透明;滞销可能是需求尾部而非错误。
  • 论文出处:2023-C228

B.10 供应商低质量样本过滤

  • 论文中的做法:比较订货与供货偏差,删除供货质量极低的33家。
  • 目的:让后续评价聚焦可用供应商。
  • 风险与改进:如果目标是风险管理,低质量供应商应作为风险而非直接消失。
  • 论文出处:2021-C066

B.11 非线性项与交互项构造

  • 论文中的做法:构造平方/非线性变量及交互项,再归一化。
  • 目的:让线性框架表达曲率和协同效应。
  • 风险与改进:先验层级原则;变量选择与评估要分离。
  • 论文出处:2021-B050

B.12 标准化/归一化

  • 论文中的做法:连续变量做Z-score或尺度归一;身高体重标准化。
  • 目的:消除量纲,稳定距离、神经网络和正则化。
  • 风险与改进:树模型通常不需要;标准化参数仅由训练集估计。
  • 论文出处:2021-B050、2025-C132

B.13 空间/时间离散化

  • 论文中的做法:镜面、锥形光束、圆周、时间离散为采样点。
  • 目的:把连续积分和几何判定转成有限计算。
  • 风险与改进:必须做步长/点数收敛与边界敏感性。
  • 论文出处:2023-A系列、2024-A系列、2025-A196

B.14 插值拟合海底地形

  • 论文中的做法:把离散测深转为连续曲面/坡面,并用随机森林辅助分析。
  • 目的:允许任意位置估计深度和梯度。
  • 风险与改进:插值不确定性应传播到测线优化;避免把预测面当真值。
  • 论文出处:2023-B477

B.15 价格区间取均值

  • 论文中的做法:将农作物销售价格区间用端点平均作为单值价格。
  • 目的:把区间数据转成确定规划参数。
  • 风险与改进:均值不是实际成交分布;应以情景/区间敏感性补充。
  • 论文出处:2024-C063

B.16 统一表格格式与三维数组

  • 论文中的做法:统一附件字段,生成作物×地块×时间的成本/产量张量。
  • 目的:便于规划变量索引和约束自动生成。
  • 风险与改进:需验证单位、季次、地块类型映射。
  • 论文出处:2024-C094

B.17 随机扰动/情景数据生成

  • 论文中的做法:用均匀、正态或灾害因子生成销量、产量、成本、价格场景。
  • 目的:将确定模型扩展为风险/随机规划。
  • 风险与改进:变量间相关必须保留;分布选择要有题意或证据。
  • 论文出处:2024-C038/C063/C094/C234

B.18 光谱等间距重采样

  • 论文中的做法:以原始波数间距中位数为步长线性插值到等距网格。
  • 目的:满足FFT与滑窗频域分析要求。
  • 风险与改进:插值会引入相关性;报告网格与原始分辨率。
  • 论文出处:2025-B157

B.19 光谱裁剪与有效频段选择

  • 论文中的做法:删除约 $1000,\mathrm{cm}^{-1}$ 以下的干扰区,并用滑窗傅里叶变换与信噪比(SNR)选择工作频段。
  • 目的:减少非稳定干扰,提高厚度反演信噪比。
  • 风险与改进:频段若用拟合结果反向挑选会产生选择偏差。
  • 论文出处:2025-B157

B.20 光谱去基线/去趋势

  • 论文中的做法:AsLS或低阶多项式估计慢变基线并相减。
  • 目的:分离干涉振荡与仪器/背景趋势。
  • 风险与改进:基线过强会吞掉真实低频结构。
  • 论文出处:2025-B157

B.21 光谱平滑去噪

  • 论文中的做法:Savitzky–Golay平滑,必要时带通滤波。
  • 目的:降低高频噪声同时尽量保持峰位和峰形。
  • 风险与改进:需报告窗长、阶数、截止频率及峰位偏差。
  • 论文出处:2025-B157

B.22 比例变量logit变换

  • 论文中的做法:对0–1范围的胎儿分数FF做logit变换。
  • 目的:解除边界、改善线性与方差稳定性。
  • 风险与改进:0或1需修正;反变换后的效应是非线性的。
  • 论文出处:2025-C023

B.23 按孕妇聚合与重复测量识别

  • 论文中的做法:由记录聚合成267位孕妇,并保留个体层级/时序。
  • 目的:避免把重复检测误当独立样本。
  • 风险与改进:聚合不能丢掉随孕周变化;训练测试必须按孕妇划分。
  • 论文出处:2025-C132

B.24 结构性缺失识别

  • 论文中的做法:女胎没有Y染色体指标视为生物结构差异而非普通缺失。
  • 目的:防止用插补伪造不存在的生物特征。
  • 风险与改进:需在模型中显式分组或移除该类特征。
  • 论文出处:2025-C132

B.25 孕周分层、Z值标准化与一致性聚合

  • 论文中的做法:按孕周建立零分布,标准化染色体指标,结合ChrX质控和多次结果。
  • 目的:降低批次/孕周效应并形成三级判定。
  • 风险与改进:分层样本量不足会使均值方差不稳;需FDR和外部验证。
  • 论文出处:2025-C023

B.26 预处理复核清单

  1. 建立数据字典,写明变量、单位、口径、主键和时间范围。
  2. 检查表连接是一对一、一对多还是多对多,复核连接后的行数与总量。
  3. 区分普通缺失、系统性缺失与结构性不存在,不对不存在的特征强行插补。
  4. 对异常值先做业务核查,再比较保留、稳健处理与删除后的结果。
  5. 插补、标准化、降维和特征筛选均只在训练数据内拟合,再应用到验证数据。
  6. 时间序列按时间验证,重复记录按对象分组,避免信息跨越训练与测试边界。
  7. 记录所有阈值、窗口、变换及随机种子,使处理过程可复现。
  8. 对优化输入做单位、边界、可行性与守恒检查,并评估参数不确定性。

附录 C:31 篇论文的方法与预处理反查

以下按手册编号列出各篇的主要方法及预处理,题目名称使用便于阅读的简称。此处保留“程序迭代”“实验设计”等论文线索,因此与附录 A 的条目不是一一对应关系。列出一种方法,只说明手册记录了它的使用,不代表已经复核其全部实现或验证质量。

C.1 2021 年:2 篇

论文编号与题目 主要算法与模型 预处理与特征工程
2021-B050 · 乙醇偶合制备 C4 烯烃 曲线拟合;逐步/多元回归;PCA;BP 网络;欧氏距离实验设计 归一化;非线性项与交互项构造
2021-C066 · 原材料订购与运输 TOPSIS;多目标/动态规划;遗传算法;程序迭代 一致性检查;过滤 33 家极低质量供应商;指标构造

C.2 2022 年:2 篇

论文编号与题目 主要算法与模型 预处理与特征工程
2022-C155 · 古代玻璃成分 CLR;卡方/Yates;回归;决策树/GBDT;R/Q 聚类;灰色关联 剔除成分总和不合格样本;成分封闭;类别量化;CLR
2022-C229 · 古代玻璃成分 Spearman/卡方;Dirichlet 回归;决策树;PLS-DA/PLS;K-means;Pearson/Wilcoxon 众数与热卡插补;零值乘法替换;成分封闭与 CLR

C.3 2023 年:10 篇

论文编号与题目 主要算法与模型 预处理与特征工程
2023-A0127 · 定日镜场 坐标变换;离散射线/无效点;变步长;二分;单目标优化 镜面与锥形光线离散化;分区同心圆降维
2023-A0165 · 定日镜场 空间向量;栅格化;三分;蒙特卡洛;单目标优化 镜面栅格化;固定变量降维
2023-A0175 · 定日镜场 坐标旋转;锥形光束;蜂窝排列;蒙特卡洛抽样;遍历 光束/镜面网格化;随机抽样
2023-A092 · 定日镜场 投影法;蒙特卡洛;遗传算法;变步长遍历 同心圆参数化降维;抽样计算截断效率
2023-B226 · 多波束测线 几何/向量;最小二乘;贪心;模拟退火;PSO 等深线分区;坡面拟合;差区再细分
2023-B311 · 多波束测线 几何;递推;多目标主要目标法 确定等深线方向;递推生成测线
2023-B477 · 多波束测线 几何;贪心;微分;随机森林;改进 MFO 插值拟合连续曲面;区域分块
2023-C050 · 蔬菜定价补货 描述统计;Spearman/Pearson;K-means++;回归;时间序列;SA;灰色关联 剔除负价退货;筛选季度/节气/节日特征
2023-C126 · 蔬菜定价补货 Shapiro-Wilk;贝叶斯/MCMC;VAR;优化 数据透视生成日销量;同期平均;频率筛选单品
2023-C228 · 蔬菜定价补货 ACF/分解;偏相关;FP-Growth;双对数弹性;LSTM;GBest-PSO;NSGA-II 自然连接;One-hot;多粒度聚合;异常/滞销清洗

C.4 2024 年:12 篇

论文编号与题目 主要算法与模型 预处理与特征工程
2024-A016 · 板凳龙 等距螺线;积分;逐步逼近;碰撞检测;矩阵比例 连续运动按时间/螺距步长数值化
2024-A053 · 板凳龙 阿基米德螺线;递推;分离轴;变步长;PSO 时间离散;碰撞候选范围缩减
2024-A163 · 板凳龙 极坐标积分;位置/速度递推;十进制逼近;判断函数 分段路径与七种位置情形
2024-A178 · 板凳龙 微元/微分方程;数值解;叉乘碰撞;二分;仿真 同心圆近似粗定位;局部变步长精搜
2024-A242 · 板凳龙 微积分;二分;动态搜索;PSO;三分 缩小碰撞邻域;粗到细搜索
2024-B159 · 生产决策 假设检验;二项分布;期望利润;状态决策;动态规划;Beta 贝叶斯 生产流程状态化;记忆化存储
2024-B195 · 生产决策 抽样验收;期望利润;多阶段决策;模拟退火;贝叶斯更新 决策转为 0-1 变量;模拟次品数据
2024-B196 · 生产决策 正态近似/t 检验;决策树;蒙特卡洛;ACO;GA;3σ 0/1 标记合格/次品;随机路径模拟
2024-C038 · 农作物种植 MILP;DEGA;CVaR;Spearman;鲁棒/敏感性 可视化;二元变量;不确定场景
2024-C063 · 农作物种植 规划求解;随机优化;乐观/期望准则;风险矩阵 耕地整理;价格区间取均值;均匀/正态抽样
2024-C094 · 农作物种植 线性规划;贪心;蒙特卡洛;随机规划;软约束 统一格式;成本/产量三维表;随机扰动
2024-C234 · 农作物种植 线性规划;GA;均匀分布;风险波动;供需关系 灾害因子与不确定因子修正产量/价格

C.5 2025 年:5 篇

论文编号与题目 主要算法与模型 预处理与特征工程
2025-A196 · 烟幕投放 运动学/几何;布尔积分;二分;多起点变步长;PSO;DE;分层优化 圆周离散与点数敏感性;预测遮蔽点降维
2025-B060 · 外延层厚度 Drude/Fresnel 双光束;波谷周期;三次样条;Newton 反演;多光束检验 样条提取波谷;多方法交叉印证
2025-B157 · 外延层厚度 Snell/Fresnel;Cauchy/Airy;FFT/STFT;非线性最小二乘;SGD 等距重采样;裁频段;AsLS;SG;带通
2025-C023 · NIPT LMM;logit;LR 检验;动态规划;Z 判定;FDR 孕周分层;Z 标准化;ChrX 质控;一致性聚合
2025-C132 · NIPT Pearson;LMM/REML;GPR;GA;DeepHit/MLP/LSTM;LightGBM/Optuna/Stacking 按孕妇聚合;拟合填缺;Z-score;结构性缺失识别##资料来源与使用边界本文正文的经验总结、方法族频次、篇幅比例与措辞统计,整理自原稿《对于数学建模国赛展示论文的研究》。附录 A—C 整理自《2021—2025 本科数学建模国赛官方展示论文:算法与数据预处理学习手册》(整理日期:2026-08-31)。该手册为研究整理材料,本文所称“官方展示”指其收录的论文来源,不表示手册本身由赛事官方编写。手册共 29 个 PDF 页面;以下定位采用页面上印刷的页码,不含封面:

祝看到这的人比赛顺利。