跳转至

自然语言处理

南京大学当期开设

版本 课程号 课程性质 学分 课表所列教师
人工智能学院 2023 级,2025-2026 学年第二学期 30000180 核心 2 吴震

信息边界

上表来自该学期官方课表。公开课表没有给出详细大纲、作业形式和考试范围,因此本页不把 HMM、LLM、RAG 或某种编程项目写成固定考核内容。

学科知识框架

自然语言处理研究如何对文本和语言信号进行表示、分析、理解与生成。常见模块包括:

  • 文本预处理:分词、子词切分、规范化和语料统计。
  • 序列标注:词性标注、命名实体识别,以及 HMM、CRF 等经典方法。
  • 语言模型:N-gram、神经语言模型和自回归建模。
  • 分布式表示:词向量、上下文表示和表示学习。
  • 神经序列模型:RNN、LSTM、注意力和 Seq2Seq。
  • 预训练模型:Transformer、BERT 类编码器和 GPT 类生成模型。
  • 评估与责任使用:数据偏差、幻觉、隐私、版权和任务适配的评估方法。

这些模块是学科地图,不代表当期课程逐项覆盖。

学习建议

  1. 先明确任务、数据单位、评价指标和基线,再选择模型。
  2. 对经典概率模型练习状态、观测和条件独立假设的形式化表达。
  3. 对预训练模型区分预训练目标、微调方式、推理约束和评估边界。
  4. 处理语料时遵守许可证、隐私和课程的学术诚信要求。

公开资源

  • [研究组织] NJUNLP GitHub:南京大学相关研究团队公开项目,不等同于本科课程资料。
  • [外校公开课] Stanford CS224n:可用于补充现代 NLP 的理论和实践背景。
  • [出版教材] 何晗《自然语言处理入门》:偏中文 NLP 工程实践,是否适合当期课程需结合大纲判断。

一手来源