開啟主選單
求真百科
搜尋
檢視 计算语言学 的原始碼
←
计算语言学
由於下列原因,您沒有權限進行 編輯此頁面 的動作:
您請求的操作只有這個群組的使用者能使用:
用戶
您可以檢視並複製此頁面的原始碼。
{| class="wikitable" align="right" |- |<center><img src=http://5b0988e595225.cdn.sohucs.com/images/20190615/a19481a8119f4625ada125512d6f30f6.png width="350"></center> <small>[https://www.sohu.com/a/320757418_100133556 来自 搜狐网 的图片]</small> |} '''计算语言学'''是全国科学技术名词审定委员会审定、公布的科技术语。 汉字,中国古人[[智慧]]的结晶<ref>[https://www.sohu.com/a/592170902_121123819 中国人中国字|看中国人专属的浪漫和智慧!],搜狐,2022-10-12</ref>。千百年间,它经历了“甲金篆隶草楷行”的发展<ref>[https://www.sohu.com/na/419245180_120271802 了不起的中华文明:汉字发展史上的三次重大危机],搜狐,2020-09-18</ref>。从记录的工具到[[艺术]]的载体,它的身上,倾注了无数先人的心血。 ==名词解释== 计算语言学(Computational Linguistics)指的是这样一门学科,它通过建立形式化的数学模型,来分析、处理自然语言,并在[[计算机]]上用[[程序]]来实现分析和处理的[[过程]],从而达到以机器来模拟人的部分乃至全部语言能力的目的。 我们所说的语言分为自然语言与人工语言两大类。自然语言是人类在自身发展的过程中形成的语言,是人与人之间传递信息的媒介。人工语言指的是人们为了某种目的而自行设计的语言。计算机语言(Computer Language)就是人工语言的一种,指用于在人与计算机之间传递信息的语言。 人与计算机之间交流信息要使用计算机语言。电脑每做的一次动作,一个步骤,实际上都是执行已经用计算机语言编好的程序。程序是计算机要执行的指令的集合,而程序全部都是用我们所掌握的语言来编写的。人们要控制计算机,利用计算机来解决问题,就一定要通过计算机语言向计算机发出命令。我们把编写程序的过程叫做程序设计,而计算机语言相应地称为程序设计语言。 计算机语言都可以用来控制计算机来解决一些实际问题。这些问题可以是数值计算问题,其操作对象就是一些由符号构成的符号串;也可以是非数值计算问题如声音、图像处理问题,其操作对象就是声音和图像等。我们应知道各种计算机语言都不是万能的,每种计算机语言都有自己的特点、优势及运行环境,有自己的应用和操作对象。 产生背景 电子计算机问世不久,人们便考虑到它的非数值运算问题,并选中机器翻译作为第一个非数值运算的课题。这个选择可以说开辟了计算机非数值应用无比广阔的领域,许多语言学理论和方法以及许多技术成果都是在它的基础上或启发下产生和解决的。例如,文字的输入输出设备、大存储装置、言语识别和文字识别等课题均在机器翻译研究初期便已提出。但是由于机器翻译是一种比较高级的人工智能,至今尚未能真正或广泛付诸应用,而计算语言学的其他方面却得到了很大发展。计算机情报检索在60年代末期便已实现,通过卫星已可进行洲际检索。利用计算机进行言语统计已成常事,在统计分析的基础上编成了一大批正序、逆序词表和频率词典,建立了各种语料库,促进了计算风格学的诞生。同时还编制了大量索引和逐词索引。大字符集的信息处理问题已得到一定解决,这为中文和其他东方语文的信息处理提供了方便条件。计算机辅助教学日趋成熟与普遍。作为人工智能一个重要分支的自然语言理解也已奠定了基础,与此相联系的文字自动识别、言语识别和言语合成等项语言工程也在蓬勃开展。计算机在实验语音学、方言研究、语法分析和词典编纂等方面也得到了越来越广泛的应用。 计算语言学之所以有这样长足的发展,是由于社会的需要。当今世界处于新技术革命时代,一个以电子计算机为基本工具的现代化语言文字信息处理系统正在世界范围内形成,这标志着高度发展的信息化社会的到来。计算语言学正是为担当这一历史使命而诞生和发展的。 基本内容 计算语言学发展到今天,按其工作性质和复杂程度,可以归结为以下3个方面: ①自动编排:这是计算机最擅长的工作,也是计算语言学中最成熟的部分。对各种语言素材进行统计、分类、排序,编辑各种词表、索引和词典,建立语料库、术语数据库等等,已经得到广泛运用。由于这些技术已经相当成熟,因而已有现成的软件包提供服务。 ②自动分析:这是一种较复杂的语言自动处理。这种自动分析系统是根据事先存入计算机内的特定语言信息进行工作,目的在于得到预先规定的结论,例如让计算机查词典或进行语法测试,均属此类。若结论有误,就证明词典或语法不够完备,需要对原先的数据或规则加以修订或补充。这类系统一般尚处于试验研究阶段 。 ③自动研究:这是一种更复杂的语言自动处理。这种自动研究系统是根据计算机内存储的一般语言信息进行工作,借助统计、比较、类推等手段,得出自己推断的结论。人工智能研究中的某些自然语言理解系统正在朝这方面努力,但目前还没有比较成熟的研究成果。 分类 计算机语言的种类非常的多,总的来说可以分成机器语言、汇编语言、高级语言三大类。 成果 计算语言学可以说是计算机和语言学相结合的产物。这种结合已经得到丰硕的成果,除了上面说到的那些应用课题以外,还表现在对语言学理论和方法的影响上。语言的定义扩展了:语言已不仅是人类重要的交际工具,而且也是人机之间的交际工具。为了满足计算机加工的要求,计算语言学最大的特点就是要求语言的形式化,因为只有形式化,才能算法化、自动化。根据这项要求,制定出一系列面向语言信息处理的自动分析方法,其中包括预示分析法、从属分析法、中介成分体系、优选语义学、扩充转移网络、概念从属论等等。这些自动分析方法,已在机器翻译和自然语言理解的系统中得到应用,并证明有效。语言的形式化是分层进行的。语法的形式化相对来说比较简单,人们已做了不少工作;语义的形式化则是一个复杂的问题,人们进行的工作还不多。而语义形式化问题解决得好坏,将大大影响语言自动加工的成效。因此,继续发掘行之有效的形式结构分析方法和语义分析方法,研究它们之间的关系,以及探讨它们在不同系统中各自使用的限度,这是计算语言学中的重点研究课题。 第五代计算机要求人们赋予它听觉(识别口语)和更强的视觉(自动识别文字),赋予它说话能力(合成言语)和听写能力(语音打字),同时还要求人们赋予它理解自然语言并把某种(或多种)自然语言翻译成另一种(或多种)自然语言的能力。这样,计算语言学工作者又需要提供各种物理参数、语言概率性等方面的数据和各种应用软件,以便同有关的专家、工程师一道共同解决为计算机增添“翅膀”这个重大课题,使之真正成为“万能的智能机器”。 完成上述任务,必须靠整个语言学界的努力和合作。尽管面向机器的语言学有其独特性,在许多方面都要另起炉灶,但是实践证明:传统语言学的基础雄厚与否对解决一些新任务有很大关系,例如传统的英汉对比语言学研究得好,就会给英汉机器翻译提供很多方便。从这个意义上讲,计算语言学只有很好地吸取传统语言学的成果并加以改造,才能得到迅速发展。 热点 值得一提的是,机器翻译是人工智能的重要分支和最先应用领域。不过就已有的机译成就来看,机译系统的译文质量离终极目标仍相差甚远;而机译质量是机译系统成败的关键。中国数学家、语言学家周海中教授曾在论文《机器翻译五十年》中指出:要提高机译的质量,首先要解决的是语言本身问题而不是程序设计问题;单靠若干程序来做机译系统,肯定无法提高机译质量。另外在人类尚未明了大脑是如何进行语言的模糊识别和逻辑判断的情况下,机译要想达到“信、达、雅”的程度是不可能的。 ==参考文献== [[Category:800 語言學總論]]
返回「
计算语言学
」頁面