编程语言对大数据工程师很重要，那么应该如何选择大数据编程语言？

环球网校·2020-05-18 13:58:06浏览收藏

地区
选择考试省份
获取验证码

请输入下面的图形验证码

提交验证

预约成功

我知道了

摘要现如今的大数据，已经被应用到了各个行业，现如今大家都知道编程语言对大数据工程师很重要，那么应该如何选择大数据编程语言？既然编程语言对大数据工程师很重要，那么应该如何选择大数据编程语言？如果大数据工程师不注意这个，可不能算称职。

有个大数据项目，你知道问题领域(problem domain)，也知道使用什么基础设施，甚可能已决定使用哪种框架来处理所有这些数据，但是有个决定迟迟未能做出：我该选择哪种语言?(或者可能更有针对性的问题是，我该迫使我的所有开发人员和数据科学家非要用哪种语言?)这个问题不会推迟太久，迟早要定夺。

当然，没有什么阻止得了你使用其他机制(比如XSLT转换)来处理大数据工作。但通常来说，如今大数据方面有三种语言可以选择：R、Python和Scala，外加直以来屹立于企业界的Java。那么，你该选择哪种语言?为何要选择它，或者说何时选择它?

下面简要介绍了每种语言，帮助你做出合理的决定。

1、如何选择大数据编程语言——R

R经常被称为是“统计人员为统计人员开发的种语言”。如果你需要深奥的统计模型用于计算，可能会在CRAN上找到它――你知道，CRAN叫综合R档案网络(Comprehensive R Archive Network)并非无缘无故。说到用于分析和标绘，没有什么比得过ggplot2。而如果你想利用比你机器提供的功能还强大的功能，那可以使用SparkR绑定，在R上运行Spark。

然而，如果你不是数据科学家，之前也没有用过Matlab、SAS或OCTAVE，可能需要番调整，才能使用R来高效地处理。虽然R很适合分析数据，但是就般用途而言不太擅长。你可以用R构建模型，但是你需要考虑将模型转换成Scala或Python，才能用于生产环境，你不太可能使用这种语言编写种集群控制系统(运气好的话，你可以对它进行调试)。

2、如何选择大数据编程语言——Python

如果你的数据科学家不使用R，他们可能就会彻底了解Python。十多年来，Python在学术界当中直很流行，尤其是在自然语言处理(NLP)等领域。因而，如果你有个需要NLP处理的项目，就会面临数量多得让人眼花缭乱的选择，包括经典的NTLK、使用GenSim的主题建模，或者超快、准确的spaCy。同样，说到神经网络，Python同样游刃有余，有Theano和Tensorflow;随后还有面向机器学习的scikit-learn，以及面向数据分析的NumPy和Pandas。

还有Juypter/iPython――这种基于Web的笔记本服务器框架让你可以使用种可共享的日志格式，将代码、图形以及几乎任何对象混合起来。这直是Python的杀手功能之，不过这年头，这个概念证明大有用途，以于出现在了奉行读取-读取-输出-循环(REPL)概念的几乎所有语言上，包括Scala和R。

Python往往在大数据处理框架中得到支持，但与此同时，它往往又不是“ 等公民”。比如说，Spark中的新功能几乎总是出现在Scala/Java绑定的位，可能需要用PySpark编写面向那些更新版的几个次要版本(对Spark Streaming/MLLib方面的开发工具而言尤为如此)。

与R相反，Python是种传统的面向对象语言，所以大多数开发人员用起来会相当得心应手，而初次接触R或Scala会让人心生畏惧。个小问题就是你的代码中需要留出正确的空白处。这将人员分成两大阵营，派觉得“这非常有助于确保可读性”，另派则认为，2016年，我们应该不需要就因为行代码有个字符不在适当的位置，就要迫使解释器让程序运行起来。

3、如何选择大数据编程语言——Scala

现在说说Scala：在本文介绍的四种语言中，Scala是较轻松的语言，因为大家都欣赏其类型系统。Scala在JVM上运行，基本上成功地结合了函数范式和面向对象范式，目前它在金融界和需要处理海量数据的公司企业中取得了巨大进展，常常采用种大规模分布式方式来处理(比如Twitter和LinkedIn)。它还是驱动Spark和Kafka的种语言。

由于Scala在JVM里面运行，它可以立即随意访问Java生态系统，不过它也有系列广泛的“原生”库，用于处理大规模数据(尤其是Twitter的Algebird和Summingbird)。它还包括个使用非常方便的REPL，用于交互式开发和分析，就像使用Python和R那样。

我个人非常喜欢Scala，因为它包括许多实用的编程功能，比如模式匹配，而且被认为比标准的Java简洁得多。然而，用Scala来开发不止种方法，这种语言将此作为项特色来宣传。这是好事!不过考虑到它拥有图灵完备(Turing-complete)的类型系统和各种弯弯曲曲的运算符(“/:”代表foldLeft，“:\”代表foldRight)，很容易打开Scala文件，以为你看到的是某段讨厌的Perl代码。这就需要在编写Scala时遵循套好的实践和准则(Databricks的就很合理)。

另个缺点是，Scala编译器运行起来有点慢，以于让人想起以前“编译!”的日子。不过，它有REPL、支持大数据，还有采用Jupyter和Zeppelin这形式的基于Web的笔记本框架，所以我觉得它的许多小问题还是情有可原。

4、如何选择大数据编程语言——Java

较终，总是少不了Java――这种语言没人爱，被遗弃，归家只有通过起诉谷歌才有钱可赚时才似乎关心它的公司(注：Oracle)所有，完全不时髦。只有企业界的无人机才使用Java!不过，Java可能很适合你的大数据项目。想想hadoop MapReduce，它用Java编写。HDFS呢?也用Java来编写。连Storm、Kafka和Spark都可以在JVM上运行(使用Clojure和Scala)，这意味着Java是这些项目中的“ 等公民”。另外还有像Google Cloud Dataflow(现在是Apache Beam)这些新技术，直到较近它们还只支持Java。

Java也许不是摇滚明星般备受喜爱的语言。但是由于研发人员在竭力理清Node.js应用程序中的套回调，使用Java让你可以访问个庞大的生态系统(包括分析器、调试器、监控工具以及确保企业安全和互操作性的库)，以及除此之外的更多内容，大多数内容在过去二十年已久经考验(很遗憾，Java今年迎来21岁，我们都老矣)。

炮轰Java的个主要理由是，非常繁琐冗长，而且缺少交互式开发所需的REPL(R、Python和Scala都有)。我见过10行基于Scala的Spark代码迅速变成用Java编写的变态的200行代码，还有庞大的类型语句，它们占据了屏幕的大部分空间。然而，Java 8中新的Lambda支持功能对于改善这种情况大有帮助。Java从来不会像Scala那么紧凑，但是Java 8确确实实使得用Java进行开发不那么痛苦。

于REPL?好吧，目前还没有。明年推出的Java 9会包括JShell，有望满足你的所有REPL要求。

5、如何选择大数据编程语言——哪种语言胜出?

你该使用哪种语言用于大数据项目?恐怕这还得“视情况而定”。如果你对晦涩的统计运算进行繁重的数据分析工作，那么你不青睐R才怪。如果你跨GPU进行NLP或密集的神经网络处理，那么Python是很好的选择。如果想要种加固的、面向生产环境的数据流解决方案，又拥有所有重要的操作工具，Java或Scala是出色的选择。

当然，不一定非此即彼。比如说，如果使用Spark，你可以借助静态数据，使用R或Python来训练模型和机器学习管道(pipeline)，然后对该管道进行序列化处理，倒出到存储系统，那里它可以供你的生产Scala Spark Streaming应用程序使用。虽然你不应该过分迷恋某种语言(不然你的团队很快会产生语言疲劳)，使用套发挥各自所长的异构语言也许会给大数据项目带来成效。

以上就是对于《编程语言对大数据工程师很重要，那么应该如何选择大数据编程语言？》的详细分析，大家可以看到，大数据企业的竞争力，在这个行业里显得很重要，这也是企业需要的东西。如果你想知道更多大数据的相关知识，可以点击下方资料下载链接。

展开剩余

资料下载

历年真题

精选课程

老师直播

更多资料 >

更多试题 >

报考

备考

政策

编程语言对大数据工程师很重要，那么应该如何选择大数据编程语言？

最新推荐