机器学习数学理论
研究学习模型背后的严格数学性质,包括泛化、优化、 可证明性与尺度扩展规律。
University of Warwick · Mathematics
英国华威大学数学系本科生
我的研究方向是机器学习数学理论,关注神经网络训练背后的严格数学结构。 我已在刘方辉指导下完成一项关于 µP 学习率迁移的理论研究, 目前正围绕 Functional Scaling Law(FSL)与 µP 下的 WSD 学习率调度迁移开展进阶研究。
Mathematics · Machine Learning Theory
我是英国华威大学数学系本科生,未来研究领域聚焦于机器学习数学理论。 我主要关注机器学习模型背后的严格数学性质,包括神经网络理论、 优化动力学、渐近行为与尺度扩展规律。
刘方辉 现为我的正式科研导师。我们已完成一项关于 µP 学习率迁移的理论研究; 当前项目进一步研究 µP 下 WSD 学习率调度的跨宽度迁移,并结合 Functional Scaling Law 分析 peak learning rate、decay ratio 与训练时长的稳定性。
在理论研究中,我尤其关注能够通过概率、线性代数、优化与渐近分析 转化为明确数学结构的问题,并希望对神经网络训练现象给出严格、 可验证的理论解释。
研究学习模型背后的严格数学性质,包括泛化、优化、 可证明性与尺度扩展规律。
关注参数化、特征学习、无限宽极限以及超参数的跨宽度迁移。
研究完整 loss trajectory、intrinsic time、WSD 调度及其尺度效率。
使用优化、概率、谱分析与渐近工具研究训练轨迹、稳定性和确定性极限。
本项目将 µP 下的单一最优学习率迁移推广到整条 WSD schedule 的跨宽度迁移, 重点研究 peak learning rate、final learning rate、decay ratio 与训练时长随模型宽度的稳定性。
研究结合 Functional Scaling Law 对完整 loss dynamics 与 intrinsic time 的刻画, 以及 µP 的宽度稳定训练动力学,旨在识别 schedule transfer 的成立区间、有限宽偏差与失效边界。
本项目研究两步深度线性 µP 网络中,宽度极限损失关于学习率的 全局几何。核心问题是:当不同宽度下的损失曲线趋于稳定后, 最优学习率是否会被唯一确定。
结果表明,唯一性是稳定的泛型现象,但并非无条件成立; 在例外情形下,应追踪完整的最优解集合而非任意单个学习率。
研究两步深度线性 µP 网络中最优学习率的泛型唯一性、 结构化非唯一性与扰动稳定性。
查看论文 PDF →我是一名四阶魔方速拧选手,参加过 WCA 官方比赛。 我的官方成绩包括四阶单次 34.22 秒、平均 41.46 秒。 魔方主页见 这里。
四阶魔方复原视频
Email: eric_feng2006@outlook.com