微软 Orca-Math 宣布推出数学求解人工智能,其性能优于巨型模型

微软发布了一款新的人工智能 Orca-Math,它在数学应用题上的表现比其他模型高出 10 倍。该人工智能基于法国初创公司 Mistral 的 Mistral 7B 模型(Meta 的 Llama 2 的变体),该模型在数学应用问题上提供卓越的性能,同时保留小规模的训练和推理执行能力。 Orca-Math 在 GSM8K 基准测试中表现出 AI 大语言模型 (LLM) 及其具有 7-70 亿个参数大小的变体中的最佳性能,除了 Google 的 Gemini Ultra 和 OpenAI 的 GPT-4 之外。 GSM8K 基准测试由 OpenAI 发布的 8,500 个不同的数学应用题和可以在中学水平解决的问题组成。

Orca-Math 是在一位“特工”的帮助下开发的,他生成了 20 万道新应用题。这些问题基于从现有开源数据集中收集的 36,217 个“示例数学应用题”,这些问题使用 OpenAI 的 GPT-4 进行解答,并用于训练 Orca-Math(一种新的 Mistral 7B 变体)。此外,Orca 团队使用“建议和编辑”代理来开发更复杂的问题,用于训练人工智能。

这个合成数据集是机器生成的数据如何有助于提高法学硕士的智力和能力、减轻对模型崩溃的担忧的一个例子。 Orca团队使用Contextual AI开发的“Kahneman-Tversky Optimization”(KTO)方法,并将其与传统的监督微调技术相结合,以提高Orca-Math模型回答数学问题的准确性。

此外,Orca 团队在允许商业用途的麻省理工学院许可下,向 Hugging Face 发布了一个人工智能生成的合成数据集,其中包含 200,000 个句子数学问题。这使得初创公司和公司能够利用该数据集。

【新闻评论】

微软新推出的AI“Orca-Math”专门研究数学文字问题,其性能令人惊叹,超过了10倍大的模型。该人工智能基于法国初创公司 Mistral 的 Mistral 7B 模型开发,是 Meta 的 Llama 2 的变体。尽管 Orca-Math 规模较小,但在解决数学文字问题的能力方面,其性能优于大多数具有 7-70 亿参数大小的人工智能大型语言模型 (LLM),除了 Google 的 Gemini Ultra 和 OpenAI 的 GPT-4。

为了开发 Orca-Math,一名特工帮助生成了 200,000 个新应用题。这些问题基于从现有开源数据集中收集的 36,217 个数学应用题样本,使用 OpenAI 的 GPT-4 进行解答,并用于训练新的 Mistral 7B 变体 Orca-Math。此外,Orca 团队还开发了更复杂的问题,用于使用“建议和编辑”代理来训练 AI。

该合成数据集的使用是机器生成的数据如何有助于提高 LLM 智力和能力的一个例子。这减轻了对模型崩溃的担忧。 Orca团队使用Contextual AI开发的“Kahneman-Tversky Optimization”(KTO)方法,并将其与传统的监督微调技术相结合,以提高Orca-Math模型回答数学问题的准确性。

此外,Orca 团队在 MIT 许可下向 Hugging Face 发布了一个人工智能生成的合成数据集,其中包含 200,000 个句子数学问题,该许可也允许商业用途。这将使初创公司和企业能够利用该数据集,为利用人工智能解决教育、研究甚至商业应用开发中的数学应用问题的能力开辟新的可能性。

Orca-Math 的发展及其结果表明,在人工智能技术的发展过程中,模型大小并不是性能的唯一决定因素。通过专门针对特定任务进行训练并利用合成数据集,即使是小型模型也可以实现高性能。这一进步不仅有助于人工智能在教育领域的应用,也有利于人工智能技术在资源有限的环境中的使用。然而,合成数据的生成和使用需要注意数据质量和偏差问题。此外,随着先进人工智能模型的发展和传播,从伦理使用和隐私保护的角度建立法规和指南也将成为一个重要问题。

微软全新 Orca-Math AI 的性能优于 10 倍大的模型.