UniMate AI

COMP9313

大数据管理

6 学分难度

课程定位 COMP9313 是 UNSW 计算机硕士专业在‘分布式计算与海量数据处理’维度的巅峰核心课。它解决了开发者在单机算力瓶颈下的终极命题:当数据量达到 PB 级、单台机器无法容纳时,如何利用成百上千台服务器协同工作?如何保证分布式系统的容错性与一致性?它是通往大数据工程师 (Data Engineer)、分布式系统架构师、及大型云平台(如 AWS, Google Cloud)研发岗位的实战通行证。它将经典的 MapReduce 思想、现代的 Apache Spark 生态与海量图形挖掘深度整合,是培养‘具备处理行星级数据能力开发者’的必修课。 技术栈与学习内容 课程围绕‘分布式存储与计算算力’展开。核心技术栈包括:Apache Spark (Scala/Python)、Hadoop 生态、HDFS 分布式文件系统、MapReduce 模型以及 Spark Streaming。学习内容涵盖:Spark 核心算子优化(RDD, DataFrame, Dataset)、分布式连接算法 (Shuffle Join, Broadcast Join)、海量流式数据处理、以及最具算法挑战的‘海量图数据管理(如 PageRank 在 Spark 上的实现)’。此外,课程引入了简单的 NoSQL 分布式数据库原理。课程强调‘算法的并行效率与集群资源的极致调度’。 课程结构 10 周理论高频产出与两个极具挑战的分布式编程项目结合。评估体系完全对接硅谷大数据标准:包含针对并行算法时间开销分析的每周 Lab、两个要求在真实集群环境运行的大型分布式处理项目(Major Project,涉及海量文本挖掘或社交网络分析)、以及一场强调分布式一致性证明、算子执行计划分析与故障恢复逻辑判定的期末综合大考。该课极其强调‘分布式思维(Thinking in Parallel)’。 适合人群 计算机硕士、或打算冲击大厂数据架构岗位的理工科生。必须具备扎实的 Java/Python 基础及 COMP9311 (数据库) 功底。如果你想搞清楚‘为什么 Google 能够秒搜全球网页’、或者渴望在未来的 AI 底层数据流水线中建立核心算力优势,这门课是你的神功。建议每周投入 25-30 小时进行代码重构与集群调试。

Course decision

选课先看

先看考核重心、截止节奏和入门要求,再决定这门课是否适合你的学期安排。

考核总权重

100%

3 项考核

最高单项

45%

Final Professional Examination

期末考试

以官方 outline 为准

Hurdle

1 项

需要单独满足

Deadline map

考核时间线

按截止周排列作业节点;持续考核会保留在下方完整考核结构中。

Week 6

Spark Practical Labs

20%

涵盖每章算子组合与执行计划优化的现场测试,强调代码的可并行性分析。

Week 10

Big Data Assignments

35%

两个高难度的并行编程项目,要求在海量数据集上实现复杂的聚合与图搜索,并满足执行时间限制。

Week 11

Final Professional Examination

45%

全面考察 MapReduce 推演、分布式算法证明、数据倾斜处理及故障恢复逻辑的深度笔试。

Syllabus

每周大纲

默认只展示每周独有的知识重点;节奏、考核、Tutorial 和避坑信息按需展开。

  1. 1

    大数据导论与分布式系统基础

    4V 挑战,垂直扩展 vs 水平扩展,CAP 定理,分布式系统的失败模型。

  2. 2

    Hadoop 生态与 MapReduce 原理

    HDFS 架构,Map 与 Reduce 抽象过程,数据分区 (Partitioning) 与排序逻辑。

  3. 3

    Apache Spark 核心架构 (RDD)

    Spark 生态图谱,弹性分布式数据集 (RDD) 定义,宽依赖 vs 窄依赖,DAG 执行图。

  4. 4

    Spark 高级算子与内存优化

    Transformation vs Action,持久化 (Caching) 策略,Spark 内存模型与溢写控制。

  5. 5

    分布式连接 (Joins) 与数据倾斜

    Shuffle Join 原理,处理数据倾斜 (Data Skew) 的技术手段,广播变量应用。

  6. 6

    灵活性周 (Flex Week)

    复习并行算法复杂度,冲刺第一个大型海量数据挖掘 Assignment,练习集群提交。

  7. 7

    Spark SQL 与 DataFrame 优化

    催化剂优化器 (Catalyst),逻辑计划 vs 物理计划,利用 Parquet 提高 IO 效率。

  8. 8

    流式数据处理 (Spark Streaming)

    微批处理机制,窗口函数 (Sliding Windows),处理事件时间与水位线 (Watermarks)。

  9. 9

    海量图数据挖掘与 GraphX

    分布式图分区,GAS (Gather-Apply-Scatter) 模型,PageRank 与社区检测并行化实现。

  10. 10

    NoSQL 系统与全课总结

    Cassandra/HBase 简介,全学期分布式图谱大闭环;期末大冲刺。

Assessment

考核结构

Big Data Assignments

两个高难度的并行编程项目,要求在海量数据集上实现复杂的聚合与图搜索,并满足执行时间限制。

35%

Week 10

Spark Practical Labs

涵盖每章算子组合与执行计划优化的现场测试,强调代码的可并行性分析。

20%

Week 6

Final Professional ExaminationHurdle

全面考察 MapReduce 推演、分布式算法证明、数据倾斜处理及故障恢复逻辑的深度笔试。

45%

Week 11

From Seniors

学长留下的

基础信息谁都查得到,真正值钱的是过来人的经验。

学姐说

比你早一年的学长留下的真实经验 —— ChatGPT 给不了。

这门课还没有学长经验,你可以是第一个 —— 注册后在课内分享。

往年考点 / 踩坑

这门课暂无往年考点记录。

毕业生去向(整体)

下面是匠人学院毕业生整体去过的公司分布(来自脱敏校友证言)。这是全平台的总体去向,不代表选这门课的人一定去这些公司。

统计自 317 份脱敏校友证言

Deloitte

6 位校友

岗位:Graduate Program · Graduate Consulting · Platform Engineer · Web developer · Platform engineer

Zerologix

4 位校友

岗位:Frontend Dev · junior frontend developer · Front-end Developer · Full Stack Developer

Servian

4 位校友

岗位:Full-stack Developer · Data Engineer · Consultant

关于这块数据,我们说实话

雇主墙来自脱敏毕业生证言(testimonials)的整体分布,无法关联到具体学员或其所选课程;仅作为毕业生去向的总体社会证明展示。

我们没有"某位学长选了这门课、后来进了哪家公司"这种可查询的个人去向档案 —— 校友证言是脱敏的,无法关联到具体的人或他选过的课。所以这里只给整体分布,不给个人路径,不编。