自然语言处理概论

发布时间:2026/9/8 21:17:55
自然语言处理概论
自然语言处理缘起1956年人工智能元年达特茅斯会议人工智能目标让机器具有人类的智能。人工智能就是要让机器的行为看起来就像是人所表现出的智能行为一样。——John McCarthy1927-2011图灵测试仍然有争议“一个人在不接触对方的情况下通过一种特殊的方式和对方进行一系列的问答。如果在相当长时间内他无法根据这些问题判断对方是人还是计算机那么就可以认为这个计算机是智能的”。---Alan Turing [1950] 《Computing Machinery and Intelligence》人工智能三大能力1.认知智能理解语言、逻辑、知识的智能,机器在知识量上超越人类,在推理上正在超越人类)是通过大量信息的输入然后在大脑的思维模式中经过处理最后输出判断的一种能力。2.感知智能具备视觉、听觉等感知的智能,机器在大部分任务上已接近或超越人类)3.计算智能特定领域中规则明确的数据快速处理智能,机器已超越人类)自然语言处理是人工智能的一个分支用于分析,理解和生成自然语言以方便人和计算机设备以及人与人之间的交流。比尔,盖茨“语言理解是人工智能领域皇冠上的明珠”自然语言处理成为人工智能认知关键的核心问题。自然语言处理 Natural Language Processing, NLP问题的提出如何让计算机能够自动或半自动地理解自然语言懂得人的意图和心声如何让计算机实现海量语言文本的自动处理、 挖掘和有效利用满足不同用户的各种需求 实现个性化信息服务自然语言处理 (Natural Language Processing, NLP) 是利用计算机为工具对人类特有的书面形式和口头形式的自然语言的信息进行各种类型处理和加工的技术。一冯志伟《自然语言的计算机处理》 上海外语教育出版社1996NLP涉及领域自然语言处理任务NLP研究内容和应用文本分类、情感分类、信息检索、自动文摘观点挖掘Opinion mining、应用情报获取机器翻译(Machine translation, MT)实现一种语言到另一种语言的自动翻译。应用文献翻译、网页辅助浏览等。问答系统社区问答 基于知识图谱的问答KBQA对话系统聊天机器人智能语音助手信息过滤 (Information filtering) – 通过计算机自动识别和过滤那些满足特定条件的文档信息。信息抽取 (Information extraction) – 从指定文档中或者海量文本中抽取出用户感兴趣的信息。文字编辑和自动校对(Automatic proofreading) – 对文字拼写、用词、甚至语法、文档格式等进行自动检查、 校对和编排。应用排版、印刷和书籍编撰等。知识库构建文字识别语音识别说话人识别/认同/验证基本问题和主要困难基本问题一形态学(Morphology)问题词(word)词由有意义的基本单位词素(morphemes)构成单词的识别/ 汉语的分词问题词素词根、前缀、后缀、词尾老虎老 虎图书馆图 书 馆re ex portreexport基本问题二句法 (Syntax) 问题句子结构成分之间的相互关系和组成句子序列的规则– 为什么一句话可以这么说也可以那么说– 如何建立快速有效的句子结构分析方法苹果我吃了。我吃了苹果。≠苹果吃了我。基本问题三语义 (Semantics) 问题语句中的意义这句话说了什么意思1) 苹果不吃了 2) 这个人真牛 3) 这个人眼下没些什么 4) 火烧圆明园/火烧驴肉基本问题四语用学(Pragmatics) 问题上下文对语句理解所产生的影响为什么要说这句话1火火 2看看鱼怎么样了困难1.大量歧义(ambiguity)现象词法歧义自动化/研究所/取得/的/成就 自动化/研究/所/取得/的/成就词性歧义“动物保护警察”明年上岗结构歧义I saw [a man with a telescope]. I [saw a man] with a telescope语义歧义人们的语言表达中大量地使用缩略语和隐喻的表达方式如 要把权力装进制度的笼子老虎苍蝇一起打。语音歧义大量同音现象多音字及韵律等歧义一行、药材好药才好。2.大量未知语言现象新词、人名、地名、术语等新含义新用法和新句型主要困难总结1.普遍存在的不确定性词法、句法、语义、语用和语音各个层面。2.未知语言现象的不可预测性新的词汇、新的术语、新的语义和语法无处不在。3.始终面临的数据不充分性有限的语言集合永远无法涵盖 开放的语言现象。4.语言知识表达的复杂性语义知识的模糊性和错综复杂的 关联性难以用常规方法有效地描述为语义计算带来了极大的困难。人脑理解语言是一个复杂的思维过程。人脑的语言认知过程到底怎样基本研究方法NLP发展脉络作为一门新兴的交叉学科自然语言处理经历了曲折的发展历程【萌芽和起步期】人类历史上最早的计算语言学研究就是机器翻译(machine translation)源于圣经《创世 纪》中的巴比塔在17世纪“普遍语言”的运动笛卡儿(Descartes和莱布尼兹(Leibniz 都试图在统一的数字代码的基础上来编写词典期间出现许多用数学方法研究语言的先 驱1954Georgetown 大学在 1BM 协助下用1BM-701计算机实现了世界上第一个 MT 系 统实现俄译英翻译1954年1月该系统在纽约公开演示随后10 多年里MT 研究在 国际上出现热潮一批自然语言人机接口系统和对话系统相继出现。【步履艰难】1964年美国科学院成立了语言自动处理谘询委员会简称ALPAC委员会调查机器 翻译的研究情况并于1966年11月公布了一个题为《语言与机器》的报告简称ALPAC报告。在ALPAC报告的影响下许多国家的机器翻译研究低潮出现了空前萧条的局面。【复苏】IBM的华生研究中心的研究人员以及卡内基梅隆大学的Baker等二支队伍在统计方法语音识别算法的研制中取得成功“隐马尔可夫模型”(Hidden Markov Model) 和“噪声信道与解码模型”(Noisy Channel Model and Decoding Model)【繁荣期】1993年7月在日本神户召开的第四届机器翻译高层会议(MT Summit IV) 上英国著名 学者J.Hutchins在他的特约报告中指出机器翻译的发展进入了一个新纪元。随着机器翻 译新纪元的开始计算语言学进入了它的繁荣期。自然语言处理流派理性主义人工提炼语言规则来对自然语言进行定性分析和处理。做精密的逻辑推理问题求解的基本思路基于规则的分析方法建立符号处理系统。【专家系统】规则库开发 N N →NP词典标注: #工作N(uc)V推导算法设计归约、推导、歧义消解方法…—知识库 推理系统 → NLP 系统理论基础• 形式语言与自动机 • Chomsky文法基础经验主义偏重于对大规模语言数据中人们所实际使用的普通语句的统计。求解问题的思路基于大规模真实语料(语言数据) 建立 计算方法。大规模真实数据的收集、标注真实性、代表性、标注信息统计模型建立模型的复杂性、有效性、参数训练方法语料库 统计模型 →NLP 系统理论基础统计学、信息论、机器学习数据驱动的翻译方法基于统计的方法三个关键问题估计语言模型概率 p(C)估计翻译模型概率 p(E|C)快速有效地搜索候选译文C使p(C)×p(E|C)最大。主要任务– 收集大规模双语句子对、目标语言句子 – 参数训练与模型优化方法融合走向深度学习走向深度学习方法深度学习近期标志性事件2016年Google AlphaGo完胜人类围棋顶尖选手2017年进化版AlphaZero已无敌手。NLP近期标志性事件—TransformerGoogle, NIPS 2017有划时代的意义《Attention Is All You Need》Transformer就是现在chatgpt的基本构成单元。Al巅峰对决双擂台语言的理解模型Google vs. OpenAIBERT系列 vs. GPT系列NLP近期标志性事件—GPT2018年GPT预训练模型展露头脚GPT采用了 Transformer 的 Decoder 部分并且每个子层只有一个 Masked Multi Self-Attention (768 维向量和12个 Attention Head) 和 一个 Feed Forward无普通transformer解码器层的编码器-解码器注 意力子层模型共叠加使用了12层的 Decoder。2019年BERT预训练模型称霸自然语言处理。NLP近期标志性事件—BERT使用堆叠的双向Transformer Encoder在所有层中共同依赖于左右上 下文。基础版是12个Encoder(12层)高级版24个Encoder24层新一代人工智能的基本格局十年来深度学习使Al从完全“不可用”走向了“可用” 但很多应用场景尚达不到“能用、管用”NLP各种任务性能显著提升研究范式快速迭代“力大者为王” vs. “智深者为上”前者高歌猛进但能走多远后者前途光明但道路曲折大模型力拔山兮气盖世GPT-31750亿参数训练一次的费用是460万美元训练 时间为355个GPU年总成本达到1200万美元大模型语言生成初步体验—国产大模型大模型语言生成初步体验—ChatGPTChatGPT也有吃瘪的时候一本正经的胡说八道—ChatGPT深度学习三境界境界一 白手起家 各家自扫门前 雪境界二 预训练大模型 大小联调境界三 预训练巨模型 一巨托众小力大〞挑战之一大模型的开发性、探索性另一条路走向“智深”“智深”挑战之一人工智能需要通过引入知识驱动谋求某种突破NLP技术纵览