自然语言处理综论

Daniel Jurafsky, James H. Martin

出版时间

2005-01-01

ISBN

9787121007767

评分

★★★★★
书籍介绍
这不是一本教你如何快速造出智能系统的工具书,而是一条从1950年代一直走到今天的思想长河。书中用大量篇幅交代:自然语言处理如何在统计与概率的范式下重新定义,香农、乔姆斯基等名字如何被纳入同一套分析框架,不同学派又如何历经分裂走向合流。正因如此,它格外适合想理解
作者简介
Daniel Jurafsky 在美国加利福尼亚大学获计算机科学博士学位, 现于美国科罗拉多大学语言学系和计算机科学系任教, 并在认知科学研究所工作, 主要研究方向为语言的概率模型和语音信息处理. 由于他在语音和语言处理方面的成就, 于1997年获美国NSF职业奖. James H.Martin 在美国加利福尼亚大学获计算机科学博士学位, 现任职于美国科罗拉多大学计算机科学系和认知科学研究所, 主要研究方向为计算语义学. 机器学习和信息检索. 冯志伟国家教育部语言文字应用研究所研究员. 博士生导师. 先后在北京大学和中国科学技术大学获双硕士位, 在语音和语言的计算机处理领域具有多年的研究经验, 曾在多个国家参与研究和教学工作, 主要研究方向为自然语言处理. 计算语言学和机器翻译, 主要著作有《自然语言的计算机处理》和《数理语言学》等18部。
精彩摘录
  • "一切科学发现,包括那些从表面上看似乎是独一无二的科学发现,原则上都是多重的。"
  • "all scientific discoveries are in principle multiples, including those that on the surface appear to be singletons."
用户评论
大牛翻译的还是很棒的,网上可以去看下mooc上斯坦福的课程,与这个基本配套
370.「生数据稀疏(sparse data)的问题。对于任何的 N元语法,如果它的出现次数充分地大,我们就有可能很好地估计出它的概率。然而,由于任何语料库的规模都是有限的,一些完全可以接受的英语单词序列难免会在这些语料库中找不到。由于找不到这些数据,任何给定的训练语料库必定会存在着大量的公认为“零概率 N元语法”的情况,当然,实际上它们也会真的存在某些非零的概率,而当非零的计数很小的时候,最大似然估计 MLE 方法也会产生非常糟糕的估计值。 因此,我们需要一种方法能够帮助我们对于这些零概率或低概率的计数得到比较好的估计结果。这意味着,为了评测我们的语言模型,需要修改最大似然估计的方法,使得可以对于任何的 N元语法指派非零的概率,尽管其中有的是从来没有在训练中观察到的。」11.05d/b
内容非常全面
大学时读过,很经典
求第二版赶快翻译完。。
入门书,内容广泛,计算机和语言学内容各占一半吧,了解到nlp各个领域以及相应的难点和方法。不过很多当下的进展没有涉及到,另外感觉翻译不是很通畅,建议不纠结词句,从例子与算法入手。
比现在的nlp书籍多好多语音识别内容,当拓展看看。
原本非常经典,翻译的很烂,建议读英文版。
第一版内容有点老,音频处理完全略过了,第三版英文版有部分网上可以看到了,挺前沿的
下载
收藏