Vincent Granville 是一位专注于数据科学的联合创始人、GenAI 科学家和机器学习专家。他于 2024 年 2 月 17 日发表了文章“30 个最常用的 Python 库”。本文介绍了可用于各种应用程序的知名且专业的库,包括 GenAI、数据动画、LLM、合成数据生成和评估、ML 优化、科学计算、统计、网络爬行、API、SQL 等。他还提到了他在使用标准库和自己开发的功能时遇到的问题。
对于合成数据生成,SDV 是最受欢迎的库,集成了 Fake 库,但 Granville 对结果感到失望,并开发了自己的工具:Genai-Evaluation 和 NoGAN-Synthesizer。对于自然语言处理,他使用 NLTK 库,但 Stopwords 模块不适合他的需求,因此他必须为特定的 LLM 组件创建单独的停用词列表。
我使用Requests进行网络爬行,还没有测试过BeautifulSoup。对于计算机视觉,我们使用 openCV 和 Pillow,对于数据视频制作,我们利用 Moviepy 库。我有使用 TensorFlow 和 Keras 进行深度神经网络的经验,但我开发了 NoGAN 来解决这个问题。
对于统计和机器学习,我们使用 Statsmodels、Scipy、Numpy、SKlearn 和 Seaborn,但我们对时间序列和地理空间数据使用专有算法。此外,我们使用 Streamlit 创建 Web API 并使用 Pandas 自动生成 SQL 查询。格兰维尔表示,这些工具和自制功能是开源、免费且有详细记录的。他是 Data Science Central 的联合创始人,也是 MLTechniques.com 和 GenAItechLab.com 的首席人工智能科学家。
【新闻评论】
Vincent Granville 是数据科学和机器学习领域广为人知的专家,曾发表过一篇关于他经常使用的 30 个 Python 库的文章。本文介绍了可用于各种应用的库,包括人工智能 (AI)、数据动画、语言模型 (LLM)、合成数据生成和机器学习 (ML) 优化。他还提到了他因对现有库感到沮丧而自己开发的一个工具。
对于合成数据生成,有 SDV 和 CTGan 等库,但 Granville 对这些库的结果并不满意,并开发了自制工具“Genai-Evaluation”和“NoGAN-Synthesizer”,可以提供更快、更好的结果。在自然语言处理(NLP)中,虽然我们使用NLTK库,但我们感受到标准库的局限性,例如需要创建我们自己的停用词列表以满足特定需求。
对于网络爬行,他们很好地利用了Requests库,但他们还没有尝试过BeautifulSoup。对于计算机视觉,我们使用 openCV 和 Pillow,对于数据视频制作,我们使用 Moviepy 库。在深度神经网络(DNN)领域,我一直在使用TensorFlow和Keras,但由于训练速度慢且结果不稳定,我开发了一个名为NoGAN的自制工具。
对于统计和机器学习,我们使用 Statsmodels、Scipy、Numpy、SKlearn 和 Seaborn 等库,但我们对时间序列和地理空间数据使用专有算法。他还表示,他使用 Streamlit 创建 Web API,使用 Pandas 自动生成 SQL 查询,并且这些工具和自制函数是开源、免费且有详细文档的。
本文展示了数据科学和机器学习领域的工作人员探索超越现有工具限制的新方法的重要性。 Granville 的经验凸显了当现有库不足以解决特定问题时开发自己的解决方案的价值。他的工作也是对开源社区的宝贵贡献,其他研究人员和开发人员有潜力利用和进一步发展他的工作。这种独特工具的开发将促进数据科学领域的创新,并导致创建更高效、更有效的解决方案。
