UniMate AI

COMP9318

数据仓库与数据挖掘

6 学分难度 中等偏难

课程定位 COMP9318 是 UNSW 计算机硕士专业在‘海量数据知识发现’维度的核心必修课。它解决了开发者从‘存储数据’到‘理解数据’的本质进化难题:如何从 TB 级的脏数据中挖掘出隐藏的关联规则?如何设计高效的 OLAP 立方体进行多维分析?它是通往数据挖掘工程师、商业智能 (BI) 专家、及高级算法分析师岗位的实战通行证。它将经典的统计学习、频繁项集挖掘与现代决策树算法深度整合,是培养‘具备洞察力的数据科学家’的必修课。 技术栈与学习内容 课程围绕‘商业智能架构与挖掘算法’展开。核心技术栈包括:Python、Scikit-learn、SQL (用于数据仓库) 以及海量数据集。学习内容涵盖:数据仓库模型(星型/雪花型 Schema)、OLAP 算子(上卷、下钻、切片)、最为核心的‘频繁模式挖掘(Apriori, FP-Growth)’、分类算法进阶(决策树、朴素贝叶斯)、聚类分析(K-means, DBSCAN)、以及最具算法美感的‘异常检测与关联规则’。课程强调‘算法在大规模数据集上的可伸缩性与计算开销’。 课程结构 10 周理论高频产出与两个渐进式编程项目结合。评估体系完全对接硅谷大数据标准:包含针对多维建模手算的期中 Quiz、两个要求‘手写高效挖掘算法’的大型 Assignment(通常涉及实现一个支持海量数据搜索的频繁项集挖掘器)、以及一场强调代数推导、决策边界判定与覆盖率分析能力的期末综合大考。该课极其强调‘逻辑表达的效率’。 适合人群 计算机硕士、或打算从事 BI 与数据挖掘的理工科生。必须具备扎实的 Python 编程与基础数据库知识。如果你想搞清楚‘超市是如何通过购物篮分析进行商品推荐的’、或者渴望在未来的商业决策中建立核心算法优势,这门课是你的神功。建议每周投入 15-20 小时进行算法复现。

Course decision

选课先看

先看考核重心、截止节奏和入门要求,再决定这门课是否适合你的学期安排。

考核总权重

100%

3 项考核

最高单项

45%

Final Professional Examination

期末考试

以官方 outline 为准

Hurdle

1 项

需要单独满足

Deadline map

考核时间线

按截止周排列作业节点;持续考核会保留在下方完整考核结构中。

Week 6

Lab Practical Quizzes

20%

涵盖每章关联规则推演与 OLAP 变换的现场测试,强调逻辑推导的准确性。

Week 10

Programming Assignments

35%

两个高难度的 Python 项目,要求在海量离散数据集上实现高性能挖掘算子,并满足 Big-O 复杂度限制。

Week 11

Final Professional Examination

45%

全面考察算法证明(FP-Growth 可行性)、聚类中心迁移判定及分类逻辑的深度笔试。

Syllabus

每周大纲

默认只展示每周独有的知识重点;节奏、考核、Tutorial 和避坑信息按需展开。

  1. 1

    数据仓库导论与多维模型

    OLTP vs OLAP,事实表与维度表,设计星型模型实现高效商业分析逻辑。

  2. 2

    OLAP 算子与物化视图

    数据立方体 (Data Cube) 定义,Iceberg Cuber,如何权衡计算开销与响应速度。

  3. 3

    数据预处理与特征工程

    数据清洗、集成、缩放与离散化,主成分分析 (PCA) 在降维中的代数实现。

  4. 4

    频繁模式挖掘 (1):Apriori 逻辑

    关联规则定义,支持度与置信度,利用先验属性剪枝搜索空间。

  5. 5

    频繁模式挖掘 (2):FP-Growth 与应用

    FP 树构造,无候选产生的高效挖掘流程,购物篮分析 (Market Basket) 实战。

  6. 6

    灵活性周 (Flex Week)

    复习频繁项集证明,冲刺第一个挖掘算法 Assignment,练习 NumPy 矩阵优化。

  7. 7

    分类算法进阶:决策树与贝叶斯

    信息增益推导,ID3/C4.5 模型,朴素贝叶斯在文本挖掘中的假设前提分析。

  8. 8

    聚类分析:发现隐藏结构

    基于原型的 K-means,基于密度的 DBSCAN,聚类质量的外部与内部评估指标。

  9. 9

    异常检测与异常值挖掘

    基于距离与基于密度的离群点判定,孤立森林 (Isolation Forests) 思想简介。

  10. 10

    挖掘前沿与全课总结

    隐私保护挖掘初步,全学期数据图谱大闭环;期末大冲刺。

Assessment

考核结构

Programming Assignments

两个高难度的 Python 项目,要求在海量离散数据集上实现高性能挖掘算子,并满足 Big-O 复杂度限制。

35%

Week 10

Lab Practical Quizzes

涵盖每章关联规则推演与 OLAP 变换的现场测试,强调逻辑推导的准确性。

20%

Week 6

Final Professional ExaminationHurdle

全面考察算法证明(FP-Growth 可行性)、聚类中心迁移判定及分类逻辑的深度笔试。

45%

Week 11

From Seniors

学长留下的

基础信息谁都查得到,真正值钱的是过来人的经验。

学姐说

比你早一年的学长留下的真实经验 —— ChatGPT 给不了。

这门课还没有学长经验,你可以是第一个 —— 注册后在课内分享。

往年考点 / 踩坑

这门课暂无往年考点记录。

毕业生去向(整体)

下面是匠人学院毕业生整体去过的公司分布(来自脱敏校友证言)。这是全平台的总体去向,不代表选这门课的人一定去这些公司。

统计自 317 份脱敏校友证言

Deloitte

6 位校友

岗位:Graduate Program · Graduate Consulting · Platform Engineer · Web developer · Platform engineer

Zerologix

4 位校友

岗位:Frontend Dev · junior frontend developer · Front-end Developer · Full Stack Developer

Servian

4 位校友

岗位:Full-stack Developer · Data Engineer · Consultant

关于这块数据,我们说实话

雇主墙来自脱敏毕业生证言(testimonials)的整体分布,无法关联到具体学员或其所选课程;仅作为毕业生去向的总体社会证明展示。

我们没有"某位学长选了这门课、后来进了哪家公司"这种可查询的个人去向档案 —— 校友证言是脱敏的,无法关联到具体的人或他选过的课。所以这里只给整体分布,不给个人路径,不编。