引言
作为一名人工智能专业的研究生,回顾 2025 年,这是充满挑战与蜕变的一年。站在年末的节点回望,我想记录下这段旅程:个人成长历程,以及在学术、创作方面的突破,分享如何平衡个人生活与技术探索的经验。
学业与成长之路
转专业与基础夯实
很多人问我是否天生就是技术大佬,其实并非如此。大学四年前四学期 GPA 3.64,加权平均分 88.87,综合测评班级第一。43 门课取得满绩点,占课程总数的 55%。
大一上学期我还在经济与管理学院,出于对技术的向往,大一下决定转专业到计算机科学与技术学院。转专业过程堪称'地狱难度'。当时对编程的理解几乎为零,甚至电脑基本操作都不利索。更麻烦的是,因为转专业,错过了大一上的《C 语言》基础课,直接开始学习《C++》和《数据结构》。面对晦涩的指针链表,我采用了一种看似最'笨'但最有效的方法:死记硬背。我把书上所有的代码,一行一行地刻在脑子里。当时我就在想:'如果有一个平台,能有人把这些天书一样的代码讲得通俗易懂该多好?'这也成了后来坚持写'保姆级教程'的初衷——因为我淋过雨,所以想给后来人撑把伞。
事实证明,笨鸟先飞是有用的。那个学期,我拿到了班级第三。除了硬啃代码,大一也是我身体机能的'最佳版本':早睡早起,坚持运动。那种高度自律的生活节奏,让我能时刻保持最佳状态去更新自己的知识库。
大二期间,为了补修大一欠下的技术债(比如 C 语言),每天满课的状态简直是在对我的大脑进行极限压力测试。幸运的是遇到了很好的老师,他不仅教我 C 语言,更是强化学习的引路人。正是因为遇到了能把底层逻辑讲得透彻的导师,我才在那个最累的学期,依然保持着对代码的热爱。由于有些课程冲突,大部分时间我在 B 站看课程,然后针对难理解知识点整理笔记。
大三阶段,正式拜入导师门下,开启科研'炼丹'之路。我们团队一头扎进了计算机视觉(CV)与深度相机的研究中。那是一段痛并快乐着的时光。快乐在于攻克算法的成就感;痛苦在于算力限制。当时实验室没有高性能 GPU,只能在云平台上按小时租赁。对于学生党来说,每一分钟流逝的都是真金白银!为了省钱,我经常要熬到深夜,等模型一跑完立马停止计费。那一阵子,我几乎成了实验室的'守夜人',直接睡在工位旁,伴着机箱的轰鸣声入眠。但也正是这些熬夜'守'出来的经验,让我积累了大量关于 Linux 环境配置、云端算力调度、模型轻量化的实战技巧。
大三这一年,核心关键词从开发者升级为 Leader。担任学院 e 智团队队长,从纳新到手把手教萌新配置环境、Debug,再到带领大家攻坚科研项目。看着学弟学妹们从小白变成竞赛大佬,拿奖拿到手软,那种满足感,比自己拿了满绩点还要爽。
大四的主旋律,似乎从'疯狂输出'变成了'静默沉淀'。为了考研,暂时减少了博客更新频率,进入了全封闭的系统内核升级阶段。在研究生复试环节,因为本科期间做了大量扎实的项目,面对老师的提问,回答得很好。那些熬夜跑通的 Demo,成了面试时最硬核的通行证。
荣誉与竞赛
回顾本科生涯,论文发表 6 篇,研究方向横跨计算机视觉、智慧农业、医药 AI、嵌入式系统等多个领域。虽然没有拿到过国家级的奖项,但这些奖项的含金量,依然是用无数个熬夜和代码换来的。在大一参加'三创赛'和'节能减排大赛',止步于校级奖项。当时什么都不懂,让老师费心指导。发现我属于典型的'成长型选手'。一开始面对从未接触过的领域,确实会手忙脚乱,但只要给我时间去训练,一旦积累了经验数据,就能迅速收敛,在这个领域做到 Top 级别。
科研认知
在技术社区混久了,大家都知道一句名言:"Talk is cheap, show me the code (project)."如果说论文是理论内功,那项目就是实战招式。本科四年,一共参与了 5 项硬核科研项目,亲历了从'小打小闹'到'国家级立项'的完整版本迭代。
很多学弟学妹问:'本科生怎么找项目?'我的答案是:不要怕,还要从校级项目开始,也不要怕去打扰导师求机会。所有的国家级项目,都是从校级一点点'跑'出来的;所有的科研直觉,都是在给导师打杂中练出来的。
何为科学?何为技术?这个问题我也纠结过很久。直到后来明白,科学是'发现',技术是'实现'。假设我们在实验室里做实验:
- 阶段一(Science): 通过大量数据发现,用近红外光照射牛奶,蛋白质会吸收特定波长的光。不同的蛋白质含量,对应着不同的剩余光强,且两者之间存在一个线性关系。这就是科学。我们在探索未知的自然规律,发现现象,解释机理。
- 阶段二(Technology): 现在有一家科技公司,基于我发现的这个规律,设计了一个电路,训练了一套算法模型,并将它们部署到一个嵌入式设备上。最终,这台仪器可以直接显示牛奶的蛋白质含量。这就是技术。我们利用已知的规律,去解决实际问题,制造工具。
我认为最理想的科研路径是:始于科学,终于技术。前面做一个敏锐的观察者,发现一种现象;后面做一个硬核的工程师,利用这种现象创造一个技术。
技术理解与进阶
机器学习的理解
目前基本上是学完了机器学习和深度学习。机器学习主要包括监督学习和无监督学习,有监督学习就是有标签的数据,无监督学习就是没有标签数据。监督学习包括分类任务,和回归任务。无监督学习包括聚类任务和降维任务。
我是怎么在实际工作中用它们的?比如'分类':想象一下,我给模型喂一堆数据——pH 值、COD、总氮等等,然后问它:'这水能喝吗?'或者丢给它一张照片:'这是几类水?'这就是典型的分类任务,非黑即白,或者多选一。
比如'回归':在污水厂,根据现在的进水情况和调节参数,预测出水达不达标;或者像我之前做的实验,用光的强度去反推牛奶里的蛋白质含量。这类预测连续数值的任务,就是回归。
无监督学习:主要包括聚类(Clustering)和降维(Dimensionality Reduction)。其中降维(如 PCA)常用于简化模型的输入特征,去除冗余信息,让模型跑得更快更稳。
透过算法看本质,我认为机器学习在工程应用中,往往扮演着'软测量'的角色。它的核心价值在于:建立'容易测量的指标'与'难以直接测量的指标'之间的对应关系。我们利用特征(Feature)去逼近真相,无论是为了预测未来,还是为了分类现状。
为什么我们依然需要传统机器学习?虽然深度学习很火,但在实际落地(Deployment)时,传统机器学习依然是王者。相比于深度神经网络的'黑盒'和庞大算力需求,机器学习模型的参数量少、计算资源消耗低,非常适合部署在嵌入式硬件或边缘设备上,实现高效、实时的现场检测。
深度学习的理解
举一个卷积神经网络用于图像识别的例子。我们的大脑其实是在不断地提取特征:黄色的、方块形状、身上有洞、穿着方裤子……当这几个特征凑在一起,我们的大脑就反应过来了:'哦!这是海绵宝宝。'AI 的原理其实一模一样。
我们把很多海绵宝宝的照片输入给 AI,告诉它'这就是海绵宝宝'。AI 就会疯狂地在这些照片里找共同点(提取特征)。通过这种训练,它不断调整自己大脑里的参数。训练好了,它也能一眼认出:'这也是海绵宝宝!'所以 AI 的本质就是提取特征,换句话说,AI 的本质是'生成'和'模仿',而不是从无到有的'创造'。
深度学习的本质,确实是一个不断提取特征(Feature Extraction)的过程。我们可以把它想象成一个漏斗:
- 前端(特征提取): 神经网络层层剥茧,将原始数据(图片、声音)中的关键信息提取出来。
- 中端(Flatten & Projection): 最后将提取到的多维特征'拍扁',展开成一个特征长条(Feature Vector)。
- 后端(高维变换与降维): 这个特征长条随后被送入全连接层。通常,网络会先将其映射到高维空间(为了让数据线性可分,把纠缠在一起的特征分开),最后再降维映射到低维空间(比如分类任务的类别数),输出最终结果。
刚入门深度学习时,很容易陷入一种'按部就班'的误区:做视觉只学 CNN,做时间序列死磕 RNN/LSTM,做 NLP只看 Transformer。这种想法虽然能解决问题,但很容易遇到瓶颈。现在,我们需要站在更高的维度去理解这一切。神经网络不应该被名字框住,它本质上就是一个处理张量变换的机器。
核心结论:深度学习最重要的就是把特征工程数据表示(Data Representation)——即如何把你手头的实验数据(无论是水质指标、光谱数据还是图片数据),优雅地翻译成计算机能理解的张量表示。
万物皆可'张量'
我们在实验室里拿到的数据五花八门,有图片、有波形、有表格。神经网络不挑食,但它只吃一种格式——张量 (Tensor)。
- 图片数据的张量表示: 一张拍摄活性污泥的显微镜照片(RGB 彩色),大小是 224*224。在计算机眼里,它就是一个 (3, 224, 224) 的立方体数据块。
- 光谱数据的张量表示: 测量的近红外光谱(NIR),横坐标是波长,纵坐标是吸光度。如果扫了 1000 个波段,它就是一个长度为 1000 的长条向量。
- 分子/化学结构的张量表示: 水分子 (H₂O)。方法 A(图神经网络 GNN):把它看作三个节点(原子)和两条边(化学键),用邻接矩阵表示连接关系,用特征矩阵表示原子属性。方法 B(序列):用 SMILES 编码(如 O 代表水),转化成类似文字的 One-hot 编码。
- 单词/文字的张量表示: 比如'污水'这个词。计算机不认识字,但我们可以查字典(Embedding 层),把它变成一个长度为 512 的向量。在这个向量空间里,'污水'和'废水'的距离很近,和'牛奶'的距离很远。
多模型协同与多模态融合
深度学习 (DL) 是顶级的'眼睛',机器学习 (ML) 是顶级的'逻辑脑'。
为什么这么做? 深度学习(如 CNN)极其擅长特征提取,能从乱糟糟的图片里找出规律;而传统的机器学习(如 XGBoost、SVM、随机森林)在数据量没那么大时,分类和回归的效果往往更稳、解释性更强。
举个栗子,预测污水处理厂的出水 COD。 第一步(DL):用一个 CNN 处理进水口的视频监控画面,它不直接输出结果,而是提取出一个描述'水面波动和颜色'的特征向量(比如 128 维)。 第二步(ML):把这个特征向量,连同传感器测到的 pH 值、温度,一起喂给 XGBoost 模型。这样 XGBoost 综合了视觉特征和数值特征,给出了一个精准的 COD 预测值。
单一的数据源就像'盲人摸象',多模态则是'眼观六路,耳听八方'。就是把不同性质的数据(图片 + 文字,声音 + 图像,传感器 + 视频)结合起来一起训练。
例如蓝藻水华预警系统,预测某个湖泊或水库未来 24 小时内是否会爆发蓝藻水华。
- 模态 A(视觉 - 宏观): 无人机拍摄的水面航拍图或卫星遥感图。使用 CNN 提取水体表面的颜色特征和纹理特征。
- 模态 B(时序 - 微观): 水下传感器监测的水温、总磷、总氮的时间序列数据。使用 LSTM 或 GRU 提取水质参数的变化趋势。
- 模态 C(文本 - 外部环境): 气象局发布的天气预报文本。提取特征:使用 Transformer/BERT 处理文本,提取气象条件。
融合效果:如果只看传感器,总磷高不一定爆发水华;如果只看照片,水变绿可能只是树的倒影。多模态融合后,模型综合了'营养够了'+'天气给力'+'苗头已现',从而给出极高准确率的红色预警。
AI 算法工程师的五重境界
我觉得 AI 可以分成这几种境界:
- 武夫: 学会了 Python 和 PyTorch。
- 金刚凡境(工程): 能做完整的工程项目。
- 自在地境(算法): 能为特定问题定制算法。
- 逍遥天境(领域): 在某个细分领域做到极致/SOTA。
- 神游玄境(开创): 开创全新的领域或流派。
未来展望
2026 年,又是一个新的起点,新的一年,我对 2026 年的一些期望:
- 巩固基础,把几大神经网络复习一下,把所有网络的实战项目再手搓一遍。针对我现在做的时间序列任务,多做些自己的网络结构。
- 下个学期选深度学习和强化学习的课程,之前基本上都是自己学习,学校的老师都超级厉害,希望可以学到更多的东西。
- 写更多高质量博客,争取阅读量破 100W+。
- 努力做好学术研究,争取可以早出一点科研方向的成果,也希望自己的科研成果可以真正的落地应用。
- 最后一个愿望希望爱我的人和我爱的人都可以平安喜乐。
给大家分享一句最喜欢的诗句吧:我们准备着我们准备着深深地领受那些意想不到的奇迹,在漫长的岁月里忽然有彗星的出现,狂风乍起。新的一年希望大家的生活中都会有彗星的出现和意想不到的奇迹。
致谢
在技术社区写了这么多代码逻辑,今天想写写代码背后的人。一个计算机学生的成长,除了自己的努力,更离不开导师们的指引。回头看这四年,我是如此幸运,遇到了这几位'神仙老师'。
- 刘老师: 既是我的本科论文导师,也是核心专业课的任课老师。在我从'经管'转到'计科'最迷茫的时候,是他无私的指导让我稳住了阵脚。他的课是必须要抢的,他的指导是必须要听的。
- 洪老师: 带我入门 C 语言和强化学习(RL)。他是我目前遇到过授课水平最高的老师。他让我明白,编程不仅仅是工具,更是一种思考世界的方式。希望未来我也能成为一名像他一样,眼里有光的老师。
- 石老师: 大二大三时,信任地把学院团队队长的重担交给了我。她是一点点教我怎么打比赛、怎么带团队的。除了搞科研,石老师最可爱的点是经常带我们出去团建吃好吃的!
- 吴老师: 中科院大气物理所的宝藏导师。超级有实力且对学生超级好。如果有学弟学妹想报考吴老师的研究生,或者对大气物理+AI 交叉方向感兴趣,欢迎交流。
计算机不是一座孤岛,代码可以定义世界,但朋友才能温暖生活。特别感谢每一位认真写下评论的你。在后台看到大家暖心的留言,真的超级感动!这是对我的认可,也是我未来可以改进的方向。未来的日子里,希望我们能继续在技术社区并肩作战。博主会继续努力,为大家带来更多硬核干货。

