开发者弹药库升级 推荐五个机器学习框架

作者: 三川 2017-04-17 13:59:37

业内知名数据科学网站 KDnuggests,昨日评选出了四月份“你不可忽视的五个机器学习项目”。

你可能没听过它们,但今天或许会考虑上手。至于那些不同生态、不同编程语言的工具——对于高手而言,即便没有使用需求,借鉴它们的代码执行也能为自己的产品开发带来许多灵感。

1. Scikit-plot

一帮缺乏艺术细胞的数据科学家,在某年某月某天突然心怀恐惧地意识到:可视化是数据科学最关键的东西之一,而不仅仅是一个加分项。

这就导致了 Scikit-plot 的诞生。

开发者弹药库升级 推荐五个机器学习框架

KDnuggests 副主编 Matthew Mayo 表示:“我注意到 Scikit-plot,是因为在 Reddit 上看到了它的作者的发帖,随后几乎立刻便上了手。”

该项目旨在为 Scikit-learn 用户提供一系列标准、实用的图表。这包括:

  • Elbow plots
  • Feature importance graphs
  • PCA projection plots
  • ROC curves
  • Silhouette plots

Scikit-plot 库有两个 API,其中一个与 Scikit-learn 紧密整合,以控制对其 API 的调用(Factory API)。另一个更传统(the Functions API)。但无论哪个都应当足够你使用。

它的快速上手指南在这里。

2. Scikit-feature

Scikit-feature 是 Python 的开源特征选取资源库,由亚利桑那州立大学的数据挖掘&机器学习实验室开发。它基于 scikit-learn、Numpy 以及 Scipy。Scikit-feature 内置约 40 个常见特征选取算法,包含传统算法以及一些结构式、流式的特征选取算法。

所有的特征选取方案,都有一个共同目标:找出多余、不相关的特征。这是一个相当热门的研究领域,对此有无数算法。

Scikit-feature 既适用于实用特征选取工程,也适合做算法研究。查看它支持的算法列表请点击这里。

一名为 Rubens Zimbres 的数据科学家曾如是说:

  • “在积累了经验,尝试了堆叠神经网络、并行神经网络、asymmetric configs、简单的神经网络、多层、dropout、激活函数等各种东西之后,我得出了一个结论:论效果,什么都比不上好的特征选取。”

3. Smile

Smile (Statistical Machine Intelligence and Learning Engine) 是一个快速、全面的机器学习系统。受益于先进的数据结构与算法,Smile 有最***的性能。

Smile 覆盖了机器学习的方方面面,包括分类、回归、聚类、关联规则挖掘、特征选取、流形学习(manifold learning,)、多维尺度分析(MDS)、遗传算法、missing value imputation、最邻近搜索等等。

开发者弹药库升级 推荐五个机器学习框架

对于使用 Java 和 Scala 的开发者,目前来看,Smile 是最合适的机器学习库。你可以把它看作是一个 JVM Scikit-learn。该项目有非常全面的官方教程,地址: https://haifengl.github.io/smile/。该教程不仅覆盖了 Smile 使用技巧,还是很高质量的机器学习算法入门资料。

如果你用 JVM 开发机器学习,Smile 绝对值得一试。事实上,如果你身在这个生态系统却没听过 Smile,才是一桩奇闻。

4. Gensim

Gensim 是一个针对话题建模、文件索引、在大语料库中进行相似性检索的 Python 算法库。目标受众是自然语言处理和信息检索社区。

Gensim 是个以完整性为目标的多面手。其开发团队称,它为“常见算法提供了高效的多核执行,比如 Latent Semantic Analysis (LSA/LSI/SVD), Latent Dirichlet Allocation (LDA), Random Projections (RP), Hierarchical Dirichlet Process (HDP) 或 word2vec 深度学习。”

Gensim 的文件在这里。KDnuggets 以前发过一篇教新手用 Gensim 搞话题建模的教程,请戳这里。

5. Sonnet

开发者弹药库升级 推荐五个机器学习框架

本月初,DeepMind 在官方博客宣布了开源 Sonnet 的消息。雷锋网***时间进行了报道:DeepMind发布Sonnet 帮你用TensorFlow快速搭建神经网络。

DeepMind 在博客中表示:

“对于 TensorFlow 而言,自从其在 2015 年末开源,一个由众多高级算法库组成的多样生态系统,便已围绕着它迅速发展起来。这些高级工具,允许常用任务以更简便、更快的方式完成,极大节省了开发者的时间精力。

作为该生态的新成员,Sonnet 也是如此。它与现有的神经网络算法库有许多共同点,但部分功能专为 DeepMind 的研究需要而设计。”

Sonnet 是基于 TensorFlow 的高级算法库。DeepMind 承认了它与一些现有产品比较类似,但整合了 DeepMind 研究所必须的功能与特性,比如允许特定模块在随机聚集的 Tensor 群组上运行:

“RNN 的状态,最适合于以异构 Tensor 集合来表示,用扁平列表来表示它们很容易会导致错误。Sonnet 提供了处理这些随机等级结构的功能,所以改变你的试验,使用另一种 RNN,并不需要繁冗地修改代码。DeepMind 已经对核心 TensorFlow 做了修改,以更好地支持这一使用情况。”

***,希望本文能够对你产生帮助。让你知道一些此前没听说过的算法库,或者你并没有意识到自己其实需要的功能。

机器学习 代码 TensorFlow
上一篇:Facebook的交互式神经网络可视化系统ActiVis,打开神经网络的“黑盒子” 下一篇:深度学习概述:从感知机到深度网络
评论
取消
暂无评论,快去成为第一个评论的人吧

更多资讯推荐

人工智能和机器学习如何从物联网数据中提取关键见解

虽然所有这些小端点都很重要,但在物联网中更重要的是这些设备所生成的大量数据,以及通过分析可以从中获得的业务见解。

iothome ·  1天前
谈谈机器学习的趋势 - 新三大学习范式

机器学习/深度学习是一个广阔的研究领域,说来并不年轻,但又朝气蓬勃,似乎每天都在涌现大量的新方法和新技术。

AIShaper ·  1天前
机器学习任务编排工具比较

最近,出现了用于编排任务和数据工作流的新工具(有时称为" MLOps")。 这些工具的数量众多,因此很难选择要使用的工具,也难以理解它们的重叠方式,因此我们决定对一些最受欢迎的工具进行比较。

闻数起舞 ·  1天前
阿斯利康利用基于PyTorch的算法发现新药物

这家制药公司透露了它如何利用先进的机器学习工具加快发现药物。

布加迪 ·  1天前
IBM secures fifth consecutive year of AI software platform market share leadership

IDC 连续第五年将 IBM®列为2019年人工智能软件平台的第一大市场份额领导者。 无论是为虚拟助手注入活力,还是改进机器学习模型, IBM Watson®都是公司的一颗璀璨明珠。

佚名 ·  2天前
机器学习是否使加密货币具有可追踪性?

加密货币能采用机器学习技术进行追溯吗?关于加密货币的可追溯性和匿名性,还有很多需要了解的事项。

李睿 ·  2天前
机器学习如何助力计算化学研究发展?

像许多实施机器学习的领域一样,它在计算化学领域的用途是从文献中获取所有已知数据,进行推断和分析,并预测最可能的结果。

蒙光伟 ·  3天前
微软推出Lobe桌面应用程序 助你轻松创建机器学习模型

2018 年的时候,微软收购了一家名叫 Lobe 的人工智能初创企业。该公司致力于通过简洁的视觉界面,帮助人们轻松创建智能应用程序 —— 无需编写任何文本代码行,即可理解手势、听音乐、阅读手写内容。

佚名 ·  4天前
Copyright©2005-2020 51CTO.COM 版权所有 未经许可 请勿转载