前言
自然语言处理是一门使用计算机以自然语言处理,处理,转换,传输,存储和分析自然语言单元的科学. 这是一门涉及语言学,计算机科学,数学,心理学,信息论和声学的交叉学科.
课程目的和基本要求:
通过学习本课程自然语言分析,您可以掌握自然语言(特别是中文)处理技术(特别是基于统计的语言处理技术)的基本概念,基本原理和主要方法,并了解当前的国际和国内语言处理技术. 发展概况,语言处理技术中的前沿主题以及应用基本原理和主要方法解决科学研究中出现的实际问题的能力. 为您在相关领域(例如网络信息处理,机器翻译自然语言分析,语音识别)的研究奠定基础.
课程的主要内容:

本课程充分说明了自然语言处理技术的基本原理,实用方法和主要应用. 在课程内容的安排上,它不仅借鉴了外国学者在计算语言学领域的最新成就,而且阐明了汉语的处理方式. 技术的特殊规律还包括实践经验和讲师的经验.
1. 自然语言处理技术简介(2小时)
自然语言处理技术的理性主义和经验主义技术路线;自然语言处理技术发展概况和主要困难;该学科的主要学科;本课程的重点和难点.
2. 自然语言处理技术的数学基础(4小时)
基于统计的自然语言处理技术的数学基础: 概率论和信息论的基本概念及其在语言处理技术中的应用. 如何处理文本文件和二进制文件,包括如何以文本形式标记属性文件;如何处理批处理文件和其他实用内容

3. 自然语言处理技术的语言学基础(4小时)
中国人的基本特征;中文语法功能分类系统;中文语法分析的特殊性;基于规则的语言处理方法. ASCII字符集,ASCII扩展集,中文字符集,中文字符编码等基础知识.
4. 分词和频率统计(4学时)
汉语分词技术发展概况;主词分割算法;中文分词技术的主要难点: 歧义的基本概念和处理方法以及未注册词的处理方法;自动识别中外名字,地名和组织名称的方法;频率统计和词汇统计分布. 并统计词频,排序输出;二进制对频率统计,统计结果浏览和其他实用内容.
5. 语料库的多级处理(6个学时)

语料库的基本概念;引进主要的国际和国内语料库;语料库处理的主要步骤;词性标注的常用方法;介绍主要的句法分析算法;中文语义标注的基本概念和常用方法;中文语义词典知网介绍. 以及如何组织语料库,如何对语料库进行字符串检索以及其他实用内容.
6. 基于统计的语言模型(4个学时)
N-gram统计语言模型的基本概念;建立统计语言模型的方法;常用的数据平滑算法; N-gram统计语言模型的应用和评估;其他现有的主要统计语言模型. 并构造了Bigram语言模型和良好的算法实现等实用内容.
7. 马尔可夫模型(4学时)
马尔可夫模型的基本概念;马尔可夫模型的几个基本问题和解决方案;马尔可夫模型的几种常用算法;马尔可夫模型的应用(语音转换,词性标注). 以及实现隐马尔可夫词性标注器的实用内容.

8. 句法分析技术(4学时)
基于语言规则的句法分析技术;基于统计的统计分析技术;相依语法概率无关上下文语法(PCFG);级联有限状态句法分析技术.
9. 文字理解技术(4个学时)
计算机自动摘要的基本理论和常用方法: 机器内部文本表示;文本分析技术;抽象提取技术;抽象生成技术.
10. 问答信息检索(4学时)
问答信息检索的基本概念;问答信息检索的主要困难;问答信息检索系统的系统结构;问答信息检索的相关技术;引入文本分类技术;问答信息检索的评价方法;介绍. 以及诸如VSM文本分类器设计之类的实用内容.
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-200575-1.html
一会退市