AI革命新趋势:红睡衣项目开辟的开源数据未来

从 LaMDA 到红色睡衣:人工智能的未来如何变得更加令人兴奋!.

为什么人工智能的未来变得更加令人兴奋:从 LaMDA 到红色睡衣项目

在拥有万亿字词汇量的模型争夺主导地位的人工智能(AI)领域,强调开源透明度的“Red Pyjama”项目正在受到关注。该项目由Together AI发起,旨在使训练数据民主化,这是人工智能进步的基础。 Red Pyjamas 正在开创人工智能开发更具包容性和协作性的未来。

红色睡衣项目首先复制用于 LaMDA(Google 强大的语言模型)的训练数据集。这个数据集被称为 LLaMA,拥有 1.2 万亿个代币,并形成了 LaMDA 的语言技能。 AI 团队共同搜索了公开的网络档案和文本数据,并使用先进的算法删除重复项并清理数据。结果就是 RedPajama-Data-1T,任何人都可以免费使用和构建。

但 Together AI 团队对此并不满意,他们创建了一个更大的数据集 RedPajama-Data-v2。这是一个包含 30 万亿个代币的庞大数据集,是从更广泛的网络数据中收集的。数据的指数级增长将帮助研究人员训练更流畅、更具表现力的模型来处理不同的任务并驾驭人类语言的细微差别。

红睡衣不仅提供数据,还构建了人工智能架构师社区。我们通过开源代码存储库和活跃的在线论坛促进协作和知识共享。这种社区精神对于加速人工智能的进步至关重要。

红色睡衣项目通过为每个人提供训练数据的访问权限,让不同的声音能够塑造人工智能的未来。这种开源方法可确保创新、透明度和问责制,使人工智能与社会需求保持一致。推广开源数据并鼓励协作的项目将为全面的人工智能生态系统铺平道路。