我用Python采集了全校课程数据,做了个智能选课推荐系统,选课再也不盲选
每到选课季不少人都有过类似的经历对着教务系统里密密麻麻的课程列表无从下手不知道哪门课含金量高、哪门老师给分宽松、哪门容易时间冲突等好不容易翻完培养方案热门课早就被抢空了。之前帮身边朋友解决选课问题索性动手从学校教务系统采集了完整的课程数据结合课程属性、历史选课记录和评分数据做了一套轻量的智能选课推荐系统。不用复杂的大模型靠基础的相似度算法和协同过滤就能给出符合个人需求的课程推荐实际用下来选课效率至少提升一倍。接下来就把完整的实现思路、核心代码和踩过的坑全部分享出来。一、前期准备需求拆解与技术选型整套系统的核心逻辑是先把分散的课程数据统一采集并结构化再通过规则过滤和算法排序输出推荐结果整体处理流程如下需求拆解整个系统核心要解决三个问题课程数据的统一采集把分散在不同分页、不同查询条件下的课程信息整合到一起包含课程名、授课教师、学分学时、上课时间地点、课程属性、考核方式等核心字段脏数据结构化处理教务系统的课程时间、教师信息格式极不统一需要清洗成可计算的结构化数据个性化推荐根据学生已选课程、专业方向、偏好难度匹配最合适的课程同时自动规避时间冲突技术选型为什么选这套技术栈而不是更重的方案采集层国内高校教务系统大多是服务端渲染的传统页面没有复杂的前端JS渲染用requestsBeautifulSoup足够速度快资源占用低比启动浏览器效率高得多处理层pandas做结构化数据处理正则做格式提取轻量高效上手成本低推荐层采用“内容相似度用户协同过滤”的混合推荐不用引入大模型小数据量下效果足够好解释性也强学生能知道为什么推荐这门课存储层数据量不大的话用CSV就够量大可以接SQLite无需额外部署服务二、分步实操从采集到推荐的完整实现2.1 课程数据采集搞定教务系统分页与表单验证国内高校教务系统大多是ASP.NET架构带__VIEWSTATE隐藏域验证分页靠POST提交表单不是URL参数。直接采集第一页没问题翻页就会报错这是很多新手第一次踩的坑。核心思路先GET首页获取VIEWSTATE和Cookie然后POST提交分页参数每次翻页都更新VIEWSTATE保持会话一致。核心代码片段import requests from bs4 import BeautifulSoup import pandas as pd # 会话保持全程复用Cookie session requests.Session() session.headers.update({ User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36, Referer: [http://jwc.xxx.edu.cn/lesson/list.aspx](http://jwc.xxx.edu.cn/lesson/list.aspx) }) def get_viewstate(html): 提取页面隐藏的VIEWSTATE参数ASP.NET站点必需 soup BeautifulSoup(html, html.parser) viewstate soup.find(input, {name: __VIEWSTATE})[value] viewstate_gen soup.find(input, {name: __VIEWSTATEGENERATOR})[value] return viewstate, viewstate_gen # 第一步先访问首页获取初始参数 url [http://jwc.xxx.edu.cn/lesson/list.aspx](http://jwc.xxx.edu.cn/lesson/list.aspx) resp session.get(url) viewstate, viewstate_gen get_viewstate(resp.text) course_list [] total_page 25 # 总页数从页面底部获取 # 第二步分页遍历采集 for page in range(1, total_page 1): form_data { __VIEWSTATE: viewstate, __VIEWSTATEGENERATOR: viewstate_gen, __EVENTTARGET: AspNetPager1, __EVENTARGUMENT: str(page), ddl_xy: , # 学院筛选条件 ddl_kc: # 课程类型筛选 } resp session.post(url, dataform_data) soup BeautifulSoup(resp.text, html.parser) # 解析课程表格 table soup.find(table, {id: dg_kc}) trs table.find_all(tr)[1:] # 跳过表头 for tr in trs: tds tr.find_all(td) course { course_id: tds[0].text.strip(), course_name: tds[1].text.strip(), teacher: tds[2].text.strip(), credit: float(tds[3].text.strip()), hours: int(tds[4].text.strip()), time: tds[5].text.strip(), location: tds[6].text.strip(), course_type: tds[7].text.strip(), exam_type: tds[8].text.strip() } course_list.append(course) # 更新下一页的VIEWSTATE viewstate, viewstate_gen get_viewstate(resp.text) print(f第{page}页采集完成当前累计{len(course_list)}条) # 保存原始数据 df pd.DataFrame(course_list) df.to_csv(courses_raw.csv, indexFalse, encodingutf-8-sig) print(f采集完成共获取{len(df)}门课程数据)几个关键细节不同学校的教务系统字段名、表单参数不一样要先按F12看一下实际的POST参数不要硬套采集频率不要太高每页间隔1-2秒避开选课高峰期不要给学校服务器造成压力部分系统有登录校验需要先模拟登录带上Cookie再访问课程列表2.2 数据清洗把非结构化课程信息转成可计算格式采集下来的原始数据看起来字段齐全其实根本没法直接用最大的问题就是上课时间字段格式极不统一比如“周一第1-2节{第1-16周}”“周三3-4节(双周)”“周五第5节{第3,5,7,9周}”还有多门课合上、多个时间地点的情况。这一步的核心就是用正则把时间、周次、节次全部拆出来结构化存储后面才能做时间冲突判断和相似度匹配。核心代码片段import re import pandas as pd df pd.read_csv(courses_raw.csv) def parse_course_time(time_str): 解析课程时间字符串返回周次、星期、节次列表 weeks [] weekday 0 sections [] # 提取星期 week_map {周一:1, 周二:2, 周三:3, 周四:4, 周五:5, 周六:6, 周日:7} for k, v in week_map.items(): if k in time_str: weekday v break # 提取节次匹配第1-2节 3-4节格式 sec_match re.search(r第?(\d)[-至](\d)节?, time_str) if sec_match: start_sec int(sec_match.group(1)) end_sec int(sec_match.group(2)) sections list(range(start_sec, end_sec 1)) # 提取周次匹配第1-16周 双周 第3,5,7周格式 week_match re.search(r第(\d)[-至](\d)周, time_str) if week_match: start_w int(week_match.group(1)) end_w int(week_match.group(2)) if 双周 in time_str: weeks [w for w in range(start_w, end_w 1) if w % 2 0] elif 单周 in time_str: weeks [w for w in range(start_w, end_w 1) if w % 2 1] else: weeks list(range(start_w, end_w 1)) # 处理离散周次如第3,5,7,9周 dot_match re.search(r第([\d,])周, time_str) if dot_match: weeks [int(w) for w in dot_match.group(1).split(,)] return { weekday: weekday, sections: sections, weeks: weeks } # 应用解析函数展开成多列 time_parsed df[time].apply(parse_course_time).apply(pd.Series) df pd.concat([df, time_parsed], axis1) # 过滤无效数据 df df[df[weekday] ! 0] df df[df[sections].map(len) 0] df.to_csv(courses_clean.csv, indexFalse, encodingutf-8-sig) print(f清洗完成有效课程{len(df)}门)补充说明真实场景里格式会更复杂可能一门课对应多个时间建议先按分隔符拆分再逐个解析除了时间教师字段也可能有多个老师同样需要拆分处理清洗完一定要抽样核对不然解析错了后面推荐全是时间冲突的课2.3 智能推荐引擎混合推荐算法实现推荐部分不用搞太复杂两种基础算法结合就足够好用基于课程内容的相似度推荐加上基于用户历史的协同过滤推荐最后加权排序。优点是轻量、不需要大量数据训练解释性强学生能清楚知道推荐理由。核心思路内容相似度根据课程的学科分类、学分、难度、考核方式计算课程之间的余弦相似度推荐和用户喜欢的课程相似的课协同过滤基于历史选课数据找和你选课风格相似的同学推荐他们选过而你没选的课规则过滤自动过滤时间冲突的课、已经修过的课、不符合培养方案的课再按综合评分排序核心代码片段import pandas as pd import numpy as np from sklearn.metrics.pairwise import cosine_similarity from sklearn.preprocessing import OneHotEncoder df pd.read_csv(courses_clean.csv) # 1. 构建课程特征向量 encoder OneHotEncoder(sparse_outputFalse) feature_cols [course_type, exam_type, credit] features encoder.fit_transform(df[feature_cols]) # 加入难度特征可根据挂科率或学生评分计算这里用学分和学时近似 df[difficulty] df[hours] / df[credit] / 10 features np.hstack([features, df[difficulty].values.reshape(-1, 1)]) # 2. 计算课程相似度矩阵 sim_matrix cosine_similarity(features) # 3. 基于内容的推荐函数 def recommend_by_content(liked_course_ids, top_n10): 根据用户喜欢的课程推荐相似课程 sim_scores np.zeros(len(df)) for cid in liked_course_ids: idx df[df[course_id] cid].index[0] sim_scores sim_matrix[idx] # 排除已经选过的课 liked_indices df[df[course_id].isin(liked_course_ids)].index sim_scores[liked_indices] 0 # 取TopN top_indices sim_scores.argsort()[-top_n:][::-1] return df.iloc[top_indices][[course_id, course_name, teacher, credit, course_type]] # 4. 时间冲突检测 def has_time_conflict(course_idx, selected_courses): 判断课程是否和已选课程时间冲突 target df.iloc[course_idx] target_weeks set(target[weeks]) target_sections set(target[sections]) for cid in selected_courses: selected df[df[course_id] cid].iloc[0] # 星期相同才可能冲突 if selected[weekday] ! target[weekday]: continue # 周次有重叠 week_overlap target_weeks set(selected[weeks]) if not week_overlap: continue # 节次有重叠 sec_overlap target_sections set(selected[sections]) if sec_overlap: return True return False # 5. 混合推荐内容相似度 热度评分 难度偏好 def mixed_recommend(selected_courses, prefer_difficultymedium, top_n15): content_rec recommend_by_content(selected_courses, top_n30) # 过滤时间冲突 valid_recs [] for _, row in content_rec.iterrows(): idx df[df[course_id] row[course_id]].index[0] if not has_time_conflict(idx, selected_courses): valid_recs.append(row) # 按难度偏好排序 result pd.DataFrame(valid_recs) if prefer_difficulty easy: result result.sort_values(difficulty, ascendingTrue) elif prefer_difficulty hard: result result.sort_values(difficulty, ascendingFalse) return result.head(top_n) # 测试输入已选课程ID获取推荐 selected [KC001, KC023, KC108] recommendations mixed_recommend(selected, prefer_difficultymedium) print(recommendations)补充说明如果有历史选课数据可以加入用户协同过滤效果会更精准构建用户-课程评分矩阵即可可以接入课程评分、挂科率、评价关键词这些数据排序权重会更合理实际使用时可以加上培养方案匹配优先推荐满足毕业要求的课程三、踩坑实录实战中最容易踩的几个坑VIEWSTATE更新不及时导致分页失效很多人第一次做教务系统采集都会遇到第一页正常第二页就返回首页或者报错的问题。本质就是ASP.NET的VIEWSTATE每次请求都会更新必须用上一次返回的页面里的VIEWSTATE提交下一次请求不能复用第一次的。还有部分系统会带__EVENTVALIDATION参数同样需要每次提取更新。课程时间解析不全导致冲突判断失效课程时间的格式远比想象的复杂有单周、双周、跳周、前八周、后八周还有一门课分多个时间段上的情况。正则写得太简单就会解析不全后面推荐出来的课全是时间冲突的。建议先把所有时间格式都统计一遍逐个写规则匹配解析完做一遍人工校验不要上来就全量跑。采集频率过高被封禁教务系统的防护一般都不强但不代表没有限制。尤其是选课高峰期服务器本身压力就大高频请求很容易被临时封禁IP甚至影响其他同学选课。建议每页间隔至少1秒错峰采集不要在选课开放的前几个小时跑脚本。推荐只看相似度忽略规则约束刚开始做推荐的时候很容易一味追求相似度结果推荐出来的课要么时间冲突要么已经修过要么不在培养方案里看起来很智能其实根本没法用。推荐系统的第一步永远是规则过滤把不符合硬性条件的全部排除剩下的再谈相似度和排序。四、总结这套方案跑下来采集一千多门课程只需要几分钟推荐响应都是毫秒级不用任何复杂的服务部署本地就能跑。对于学生个人或者班级使用完全足够。核心思路其实很简单先用结构化的方式把零散的课程数据整合起来再用规则过滤掉不符合要求的选项最后用基础的相似度算法做排序。不需要大模型不需要大数据解决实际问题才是关键。

相关新闻

旧华为手机救砖降级实战:MRT HW Tool一键脚本避坑指南

旧华为手机救砖降级实战:MRT HW Tool一键脚本避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 8:02:22 阅读更多 →
板载声卡跑ASIO实战:官方驱动实现低延迟直播唱歌

板载声卡跑ASIO实战:官方驱动实现低延迟直播唱歌

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 8:02:22 阅读更多 →
Kornia 2D 边界框形状校验修复:`infer_bbox_shape` 与 `bbox_to_mask` 拒绝 rank-4 批处理输入并抛出 `ShapeError`

Kornia 2D 边界框形状校验修复:`infer_bbox_shape` 与 `bbox_to_mask` 拒绝 rank-4 批处理输入并抛出 `ShapeError`

计算机视觉人工智能深度学习图像处理 【免费下载链接】kornia 🐍 Geometric Computer Vision Library for Spatial AI 项目地址: https://gitcode.com/gh_mirrors/ko/kornia 点击查看 免费下载 本文解读 Kornia 几何模块中的一项行为修复(对…

2026/9/24 8:02:22 阅读更多 →

最新新闻

20页的复盘只动3页,AI改完其他页没乱

20页的复盘只动3页,AI改完其他页没乱

20页里只动3页 一位每天跟表格、文档打交道的人,手上刚做完一份月度复盘:一份数据表,加一份20页的汇报文件。开会前一天,他往表格里加了一张决策看板,又在汇报文件里挑出3页重排——其余17页,全都没动。 整…

2026/9/24 8:41:58 阅读更多 →
AI科研工具助力科研效率提升 解锁前沿学术研究新路径

AI科研工具助力科研效率提升 解锁前沿学术研究新路径

每次找到心仪的外国文献,却被付费墙冷冷地挡在外面,是不是感觉科研的热情瞬间被浇灭?作为学生党,我太懂这种无力感了。但好消息是,通过几个合法且免费的“通道”和技巧,我们完全能实现“文献自由”。今天分…

2026/9/24 8:41:58 阅读更多 →
Flink Hive 方言查询(Queries)完全指南:从 SELECT 语法到 Sort/Cluster/Join/CTE 实战

Flink Hive 方言查询(Queries)完全指南:从 SELECT 语法到 Sort/Cluster/Join/CTE 实战

大数据流处理批处理数据工程 【免费下载链接】flink 项目地址: https://gitcode.com/gh_mirrors/fli/flink 点击查看 免费下载 导读 Hive 方言是 Flink 为兼容 Hive 生态提供的 SQL 解析与执行模式:启用后,你可以直接在 Flink 中编写 HiveQ…

2026/9/24 8:41:58 阅读更多 →
EMC四大测试CE/RE/CS/RS本质解析与协同设计

EMC四大测试CE/RE/CS/RS本质解析与协同设计

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/24 8:41:58 阅读更多 →
LanceDB Node.js 多向量搜索:理解 MultiVector 类型别名与多向量查询实战

LanceDB Node.js 多向量搜索:理解 MultiVector 类型别名与多向量查询实战

向量数据库数据库人工智能后端 【免费下载链接】lancedb Developer-friendly OSS embedded retrieval library for multimodal AI. Search More; Manage Less. 项目地址: https://gitcode.com/gh_mirrors/la/lancedb 点击查看 免费下载 MultiVector 是 lancedb/lan…

2026/9/24 8:41:58 阅读更多 →
2026届美术生如何平衡专业课集训与文化课的学习节奏?

2026届美术生如何平衡专业课集训与文化课的学习节奏?

写作方向:实操方法型2026届美术生平衡专业课集训与文化课节奏的核心逻辑,不是每天对半切分学习时间,而是顺着集训全周期的阶段目标动态调整精力占比,把文化课拆解成“日常碎片化积累考后集中冲刺”两个模块,从根源上避…

2026/9/24 8:40:57 阅读更多 →

日新闻

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为…

2026/9/24 0:00:19 阅读更多 →
单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

单细胞注释实战:基于Scanpy的标记基因与参考映射流程解析

简介:一份基于单细胞RNA测序数据的细胞类型注释算法研究Python毕业设计源码,针对计算机相关专业正在做毕设或需要项目实战的学习者,可用于课程设计与期末大作业。项目代码完整、经导师指导评审通过,可直接运行,覆盖数据…

2026/9/24 0:00:19 阅读更多 →
C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

C#源生成器实战:用增量生成器替代反射,告别AOT崩溃

第一次在项目里被反射卡住,是在一个老旧的WinForms模块里:几十个类依赖PropertyChanged通知,运行时反射读属性、发通知,每次启动慢半拍不说,一上.NET Native/AOT裁剪模式几乎全面崩盘。后来我把这段逻辑全部改成C#源生…

2026/9/24 0:00:19 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/23 4:55:02 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/23 4:49:06 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/23 9:53:41 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/23 9:53:40 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/23 9:53:40 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/23 9:53:40 阅读更多 →