2020 年信息和通信白皮书在第一部分第 2 章第 2 节中讨论了小规模语言模型 (SLM) 和物理 AI 的趋势。白皮书将具有多达 100 亿个参数的模型视为 SLM。日本国立情报学研究所教授佐藤一郎表示,由于通用LLM有望成为商品,因此日本应该专注于特定领域的人工智能。他指出,日本可以通过在国际标准化方面领先以及将利用人工智能提高质量的工作方法扩展到海外来获胜,以火车司机进行的指向检查为例。
Preferred Networks Group 的边缘设备轻量级模型 PLAMo Lite 在日本问答 JSQuAD 中得分为 0.86。 2025年,该公司致力于开发面向边缘环境的轻量级视觉语言模型,作为GENIAC第三期的主题。东京大学松尾实验室的 EQUES 宣布推出针对制药行业的专业法学硕士“JPharmatron-7B”。
在日本总务省的一个项目下,乐天移动、AWL 和乐天神户胜利船于 2025 年 6 月开始在神户 Noevir 体育场进行使用 SLM 的边缘 AI 演示。计划实施期至2026年1月。
了解白皮书
白皮书选定的两项技术
第 2 章第 2 节包含序言。 AI领域每天都有新技术、新模式层出不穷,不可能面面俱到。这就是为什么——
考虑到日本的优势和潜力,
趋势概述。
它不是详尽无遗的,而是有选择性的。被选中的是小语言模型 (SLM)和物理人工智能有两个。
两者与“利用巨大的计算资源追求多功能性”的路径是不同的路径。如果您还记得第一部分中提到的数字,您就可以了解此选择的背景。 2025 年获得融资的人工智能公司数量美国为 1,953 家,日本为 56 家。各国研究实力排名为第10至第12位。它可以被解读为基于意识到没有体力去正面竞争的一段话。
“规模有多小”尚未确定
SLM是Small Language Model的缩写,指的是参数数量比LLM更少的模型。然而,“小”的标准尚未确定。
| WHO | 什么是可持续土地管理? |
|---|---|
| 海外标杆研究论文 | 70亿以下 |
| 国际商业机器公司 | 白皮书介绍为“几十到几百亿”。 |
| 人工智能学会论文 | 也有低于140亿的情况 |
白皮书自己画了这条线,因为它太宽泛了。最多约 100 亿个参数。
这里需要注意一点。
白皮书将IBM的观点介绍为“数十亿到数百亿”,并在源页面上添加了脚注。参考日期:2026年1月30日是这样写的。另一方面,截至 2026 年 7 月的同一 IBM 日语页面描述 SLM 中的参数数量从数百万到数十亿不等。
该页面很可能在过去六个月内更新过,因此不可能得出其中任何一个是错误的结论。然而,在比较定义时,不仅要看数字,还要看描述是在什么时间点写的。——这可能是对SLM一词尚未固化的意外确认。
根据白皮书的脚注,低于 140 亿的案例来源是 Hiroaki Sugiyama 的一篇论文(《人工智能》第 40 卷第 3 期,人工智能学会)。我认为,承认行政文件没有统一的定义,然后制定一个工作定义,是一个谦虚但诚实的举动。
在边缘移动意味着什么
SLM 的好处不仅仅是轻量级。它很轻,因此您可以用手移动它。
由于计算量被抑制,即使在计算资源和能力有限的环境中也能运行。换句话说边缘装置它适合于执行,这就是本质...
完全本地推理配置消除了每次处理数据时将数据发送到云端的需要。然而,也有边缘系统使用通信来更新模型、搜索外部信息以及链接多个设备。
由于可以创建不需要发布数据的设计,因此白皮书从隐私保护、个人信息安全等角度来看,期望值越来越高。被写。这就是为什么它有望用于金融和代码生成等敏感领域。它还与系统在公司自己的设施内运行的本地环境兼容。
另一方面,也明确指出了限制。保留少量参数知识范围狭窄和复杂推理方面的弱点因此,在实践中,我使用RAG来补充外部知识,或者结合使用LLM和SLM配置有效且有条理。
SLM 并不是 LLM 的替代品,而是一个角色伙伴。
预测“只有 PC 才需要 SLM”
国立情报学研究所佐藤一郎教授指出的一段话很引人注目。
对于智能手机和平板电脑,可以在设备上运行的SLM的性能存在限制,并且不确定是否能达到令用户满意的水平。这就是为什么SLM 的使用不是强制性的。
然而,计算机却另有说法。为了区别于智能手机和平板电脑,SLM 功能可能变得至关重要。
需要 SLM 操作的设备和不需要 SLM 操作的设备之间的两极分化日益严重。
这是与购买新产品的决定直接相关的预测。“AI驱动的PC”不仅仅是一个广告口号,而是划分品类的条件。因为它看起来就是这样。这也是我想提请大家注意的部分。
以您的经营方式而非模式取胜。
本节中最重要的一点如下。
通用LLM有望成为一种商品
商品化意味着产品变得更加难以差异化并成为普通产品。不管是谁生产的,最终都是相似的,并被价格竞争所消耗。因此,日本应该关注特定领域的人工智能。这是佐藤教授的论点。
应针对的领域是:语音人工智能和,可以利用市场广阔的制造现场以及日本工作安全性高、品质高的特点等领域。。
我们不会以抽象理论结束,而是提供具体的例子。
列车司机进行“指向确认”。
目前,工作仅限于确认项目实施人。如果我们把人工智能放在这里,当您忘记检查指向时,人工智能现在会指出。
教授看到了前方的商机。实现高安全性和高质量,包括指向确认很多日本式的经营方式还没有被海外采用。这就是为什么——
日本的胜利之路可能是将其利用人工智能提高质量的安全商业实践扩展到海外,并在商业实践的国际标准化方面发挥带头作用。
我们输出的不是模式,而是我们做生意的方式。就是这个想法。
我们在第一部分中看到的数字在这里开始具有不同的含义。对于日本企业对生成式AI的期望效果,“效率的提高”排名第一,为61.6%,其次是“质量的提高”,为32.2%。其他三个国家在质量改进方面均排名第一。
过分强调效率也可能被视为弱点。然而,另一方面,这也意味着他们拥有保证质量的业务流程。能不能重新解释,就关系到佐藤教授的建议能不能用得上。
2025 年,该教授将出版《2030 年下一代人工智能:日本的制胜之路》(日经 BP)。
准确读取 PLAMo Lite 上的数字
本节中唯一的数值性能比较是来自首选网络组的 SLM。「PLaMo Lite」日本表演。
| 基准 | PLAMo Lite(1B) | 比较目标 |
|---|---|---|
| JSQuAD F1(日语问答) | 0.86 | Phi-2(2.7B)0.34/Gemma(2B)0.65 |
| WMT20 4shot(日英翻译) | 0.20 | Phi-2(2.7B)0.021/Gemma(2B)0.14 |
| 贾斯特 0 次射门 | 58.0% | GPT-3.5涡轮56.7%/燕指令(13B)42.4% |
1B是10亿个参数。比较目标Phi-2大2.7倍,Gemma大2倍,Swallow Instruct大13倍。尽管如此,它仍然优于日本基准,并略高于 Jaster 中的 GPT-3.5 Turbo。
让我为这些数字添加一些背景知识。 PLAMo Lite 是我们的子公司 Preferred Elements 从头开始开发的 1000 亿参数模型。PLAMo-100B这是基于.的开发成果构建的10亿参数模型。预学习包括由 PLAMo-100B 生成的日语和英语文本。4万亿代币被使用。它的独特之处在于它利用大型模型生成的知识和数据来开发小型模型。
不过,需要补充一件事。
这个基准是于 2024 年 8 月 28 日开始服务时宣布是。该白皮书也使用该公告作为其来源。距离比较目标 GPT-3.5 Turbo 已经过去近两年了,Preferred Networks 本身正在将这一代推进到 PLAMo 2 和 PLAMo 3。
将此数字解读为“当前模型总体性能超过 GPT-3.5”是不合适的。尽管如此,它在日语任务上的表现优于具有 10 亿个参数的 13 倍大模型,这一事实表明了 SLM 方向的可能性。白皮书使用这些数据的目的也可以解释为提供方向而不是最新信息。
Jaster 是评估日语语言表现的标准基准,GENIAC 是其中,使用六个类别进行评估:NLI、QA、RC、MC、MR 和 FA。设计是这样的,每一个正确的答案都会给你 1 分。
使用国家考试题进行评估的模型适用于公司环境。
另一个例子是一家源自东京大学松尾实验室的初创公司。骑士制药行业专业法学硕士「JPharmatron-7B」是。
白皮书指出,“它在全国药剂师和医生考试中的表现优于当时发布的其他模型。”
关键是70亿个参数的规模。根据该公司的公告,由于这种轻盈,它还可以在公司网络或本地环境中运行。
制药行业处理临床试验数据和未发表的化合物信息。对于处理无法发布的数据的行业来说,“手头工作”与绩效同等重要。SLM的价值就浓缩在这里。
EQUES还考虑到制药和制药科学领域缺乏评估标准。“JPharmaBench”是一个独特的基准,由三项任务组成:日本国家药剂师考试、姓名识别和差异检查。被创建并发布。该公司宣布同规模开放型号Meditron3-Qwen2.5-7B和Llama-3.1-Swallow-8B-Instruct-v0.3两款车型对比,据说已经超过了所有评价项目。
不仅创建模型,还创建量尺。这个案例研究告诉我们,这就是领域专业化的意义所在。
由经济产业省和NEDO制定吉尼亚克它是一部分。 GENIAC也出现在这里。
在神户诺埃维尔体育场尝试过的事情
第三个是经过现场实际测试的系统。
乐天移动株式会社,在边缘AI方面具有优势AWL有限公司、乐天神户胜利船株式会社这3家公司被选为总务省“地域DX推进配套事业(AI验证型)”的一部分。神户诺埃维尔体育场我们开始了演示。根据各公司的公告,开始日期为2025年6月,计划实施期至2026年1月据说
构图巧妙。
靠近监控摄像头《远方的边缘》和多个远边“边缘服务器”连接与。 Far Edge 配备图像识别 AI 来检测和分析人员和异常情况。和 -
根据边缘服务器的通信拥塞和风险,将信息压缩为文本、视频或静态图像。
如果紧急程度较低,请使用浅色文本,如果重要,请使用视频。它旨在通过根据情况改变发送内容的形状来减少通信负载。边缘服务器处理从多个远端接收到的信息。与 SLM 集成以生成摘要和说明以向安全人员报告我会。
白皮书列出了与云人工智能相比的预期收益。不易受到通信拥塞的影响和,与在云中使用高性能 GPU 相比,节省电力和成本有两点。此外,各公司的公告中都将减少通信量、优化通信负荷作为验证项目。
大型设施的安全是一种“需要在通信拥塞的地区实现即时性”的应用。这个案例准确地说明了 SLM 在哪些方面可以发挥作用。
物理人工智能中也重复了相同的结构。
我还将谈到本节的另一个支柱:物理人工智能。
CRDS(日本科学技术振兴机构研究开发战略中心)的定义如下。体现人工智能通过传感器、执行器等物理机制与环境交互,并根据获得的输入和动作结果获取和开发智能。
关于日本的立场,CRDS 材料的组织如下。美国和中国强调实现大规模、数据驱动的多功能性。日本的做法是针对特定领域的,强调实用性,并在各个领域利用适合社会实施的机器人技术。
这与佐藤教授在 SLM 部分中所说的想法相同,“我们应该关注特定领域的方法。”尽管技术不同,但策略的轮廓是相同的。
佐藤教授还指出了利用物理人工智能获胜的具体方法。利用熟悉工作流程的人力资源,例如在日本工厂工作过的经验丰富的工人,继续进行人工智能学习。并且在现场的实际应用中,与其试图自动化所有任务,重要的是区分应该由人类完成的任务和应该留给机器人的任务。
这与指向确认完全相同的想法。利用人工智能来强化该领域已有的“如何做好事情”。
白皮书列举了东京大学的触觉传感器片(20厘米见方的476个传感器,五根手指的190个传感器)、Thinker Inc.的接近传感器、FANUC的开放平台、ugo的“ugoPro”和Preferred Robotics的“Kachaka”等具体示例。这些主题足够深入,值得单独写一篇文章。
称为 GENIAC 的通用骨干网
当你阅读这篇文章时,一个名字会反复出现。
吉尼亚克(生成人工智能加速器挑战)。这是经济产业省和NEDO共同发起的生成式AI开发支援计划。
| 事例 | 与 GENIAC 的关系 |
|---|---|
| 首选网络视觉语言模型 | 被选为第三个主题 |
| 骑士「JPharmatron-7B」 | 2024 年 10 月通过为第二届任期 |
| Direava(外科手术支援) | 天才主题 |
| 图灵(自动驾驶) | 天才主题 |
如果你关注每家公司发布的公告,你就可以看到双方关系的深度。PLAMo-100B 是 PLAMo Lite 的前身,是在 GENIAC 的支持下从头开始开发的。此外,在PLaMo Lite的性能评估中,使用了源自LLM-jp的Jaster的六个类别,Preferred Networks将其描述为“GENIAC独有的一组类别”。
许多模型开发和示范案例都得到了GENIAC的支持,现有的评估基础设施也被用作政策项目的共同尺度。就是这样的关系。
白皮书没有明确说明这种成分,但当你把它们并排放在一起时就很清楚了。日本的特定领域人工智能基于公共支持计划的增长这就是它的样子。这既是一种力量,也是一种依赖。当支持被切断时,它还能自行移动吗?这很可能是未来的重点。
领域专业化是一种选择而不是一种逃避吗?
最后,我们应该如何接收本节中的索赔?
如果你读到“我们不能以通用目标取胜,所以我们专业化”,这听起来像是倒退的借口。但也可以用另一种方式来解读。
在边缘工作的 SLM 的价值来自于它的小规模。可以设计防止数据被泄露。减少对通讯的依赖。这是省电的。这些特性使得在相同的终端性能、功耗和通信条件下很难创建更大的模型。能够在制药公司的内部环境中运行一个模型来处理包括国家考试问题的评估,并确保体育场安全不易受到通信拥堵的影响,这是因为我们规模较小而成为可能的两件事。
指向确认示例表明日本职场积累的工作方法具有AI学习教材的价值这就是观点。它是独立于模型性能竞赛的资产。
然而,这种方法的发挥是有条件的。正如我们在第 1 部分中看到的,24.5% 的日本公司“拥有生成式人工智能来学习内部数据或构建可参考的数据库”。这明显低于中国的73.0%、美国的57.2%和德国的54.4%。
为了充分发挥现场实践的价值,需要将其组织成可以作为数据和规则的形式。通过商业实践取胜的策略取决于此......我就是这么读的。
专业领域的选择是否正确还有待确定。然而,白皮书选择这两种技术并两次陈述相同的结构化战略这一事实仍然是表明日本人工智能政策方向的记录。
[编者后记]
当行政文件中出现“指点确认”四个字时,我笑了。讨论日本人工智能战略的材料包括铁路运营的例子。然而,当我继续阅读时,我意识到这并不是什么好笑的事情。这是因为没有人模仿的习惯可以成为一种资产。
不过,这一策略是有条件的。从第一部分可以看出,24.5%的日本企业正在“学习内部数据或建立数据库”。为了从现场方法中提取价值,必须将其转化为可用的形式。为了向 AI 教授指向确认,您首先需要记录指向确认。
在写这篇文章时,还有一件事让我思考。在组织SLM定义的表格中,白皮书中绘制的IBM数字与IBM页面上当前的数字不同。参考日期包含在白皮书的脚注中。半年的时间里,同一页面上的描述似乎已经发生了变化。尽管这些数字可能看起来准确,但除非您追踪来源和日期,否则您可能无法辨别。
在你的工作场所中必然存在一些在外界看来不寻常的“把事情做好的方法”。这是一个麻烦的做法吗?或者它是一种尚未被人意识到其价值的资产?
请注意,这次我们没有深入研究物理人工智能,白皮书将其与 SLM 一起处理。还剩下一些材料可以单独撰写文章,例如 476 张触觉传感器、接近传感器以及 Moonshot 目标 3 的 14 名项目经理。
【术语解释】
小语言模型 (SLM):小语言模型的缩写。指参数数量比大规模语言模型(LLM)更少的模型。确切的定义并不统一,白皮书将大约100亿个参数的模型视为SLM。
参数:模型通过学习获得的内部数字的集合。它用作指示模型比例的指南。 1B表示10亿个参数。
边缘装置:在本地终端侧处理数据而不将数据发送到云端的设备。这包括计算机、智能手机、工业设备、机器人等。SLM 适合在这些环境中执行,因为它需要较少的计算。
本地环境:系统在公司自有设施内安装和运行的形式,不使用云。在处理机密数据的情况下选择。
RAG(搜索扩展生成):一种搜索外部材料并通过反映内容生成答案的机制。白皮书将其列为弥补SLM知识覆盖面狭窄的有效方法。
商品化:产品变得难以区分,并被视为一般产品。白皮书中出现的专家表达了对通用法学硕士的这一看法。
领域特化型AI:经过训练的人工智能专注于特定行业和任务。尽管它比通用型号更轻,但它可以在该领域表现出高精度。
JSQuAD:评价日语问答能力的基准。衡量您阅读文本和回答问题的能力。 F1是集准确性和综合性于一体的评价指标。
贾斯特:评估日语语言表现的标准基准。 GENIAC 使用一组六个类别进行评估:NLI、QA、RC、MC、MR 和 FA。正确回答所有问题即可获得 1 分。
0发/4发:0shot是一种让AI在不给出任何例子的情况下解决问题的方法,4shot是一种让AI在给出4个例子后就能解决问题的方法。
代币:AI处理句子时的最小单位。对应于单词或字母的一部分。用作训练数据量的指标。
物理人工智能:体现人工智能,通过传感器、执行器等物理机制与环境交互,并根据获得的输入和动作结果获取和开发智能。这是日本科学技术振兴机构研究开发战略中心的定义。
执行器:移动物体的装置,例如电机。这对应了物理AI在现实空间运行时的输出机制。
远边:位于边缘、最靠近传感器或相机的处理设备。在神户诺埃维尔体育场的演示中,它将安装在监控摄像头附近,负责图像识别。
边缘服务器:连接多个远边并对收集到的信息进行整合和处理的设备。科比演示使用 SLM 来汇总信息并为保安人员生成报告。
GENIAC(生成式人工智能加速器挑战赛):经济产业省和 NEDO 的一项支持计划,旨在加强生成型 AI 的开发能力。我们将为开发和演示提供计算资源和支持。白皮书中的几个示例都是由该计划产生的。
当地社区DX促销套餐业务(AI验证型):总务省的一个项目,支持在该地区实施数字技术。神户诺埃维尔体育场的 Edge AI 演示就是在此框架内进行的。
[参考链接]
总务省|信息和通信白皮书(外部)
作为白皮书入口的官方页面。整合了 1970 年以来每种格式、英文版本和回溯编号搜索的链接。
IBM|什么是小语言模型(SLM)?(外部)
白皮书引用的页面作为 SLM 的定义之一。目前我们描述的参数数量从数百万到数十亿不等。
首选网络有限公司(外部)
PLAMo系列开发公司的官方网站。我们的子公司 Preferred Elements 负责基础模型的开发。
首选网络|PLaMo Lite 现已上市(外部)
公告日期为2024年8月28日。这是基准值的原始来源、4万亿代币预训练以及本文对Jaster的解释。
PLAMo官方网站(外部)
PLAMo系列API和聊天服务应用页面。您可以查看国产基础车型的提供表格。
首选网络技术博客(外部)
公司的技术博客。 PLAMo系列的发展历史和评估结果已经发布,让您可以追踪模型的代际变化。
埃克斯有限公司(外部)
一家源自东京大学松尾实验室的人工智能初创公司。我们将致力于特定领域人工智能的开发和社会实施,包括制药领域。
EQUES|开发医药专用大规模语言模型“JPharmatron-7B”(外部)
它描述了 JPharmaBench 的配置,并且它可以在具有 70 亿个参数的内部网络或本地环境中运行。
抱脸|EQUES/JPharmatron-7B(外部)
JPharmatron-7B 的公共页面。您可以查看该型号的详细规格、评估结果以及使用时的注意事项。
抱脸|EQUES JPharmaBench(外部)
制药和制药科学领域的评价基准。它由三项任务组成:日本国家药剂师考试、姓名匹配和不一致检查。
AWL有限公司|神户诺埃维尔体育场的示威活动(外部)
宣布示范的选择和结构的公告。您可以了解 Far Edge 如何确定风险级别和通信拥塞。
乐天移动 |神户诺埃维尔体育场的示威活动(外部)
解释演示目的和结构的演示。它展示了一种分三个阶段发送信息的设计:文本、图像和视频剪辑。
LLM-jp|llm-jp-eval(外部)
生成 Jaster 的日本评估基础设施的公共存储库。这是 GENIAC 中使用的类别集的基础。
思想家有限公司(外部)
一家开发接近传感器的公司。我们处理实时测量物体距离和姿势的技术。
优戈有限公司(外部)
2018年成立的机器人开发公司。“UgoPro”荣获2024年第11届机器人大奖优秀奖。
首选机器人有限公司(外部)
一家从 Preferred Networks 分拆出来的公司。 “卡查卡”荣获2024年第11届机器人大奖总务大臣奖。
日本科学技术振兴机构研究开发战略中心 (CRDS)(外部)
提供本文引用的物理 AI 定义的组织。我们不断传播研究和开发的战略建议。
国立情报学研究所(外部)
白皮书中出现的佐藤一郎教授所属的研究机构。我们负责从信息学基础到应用的广泛研究。
[参考文章]
総务省|令和8年版 情报通信白书 PDF版(外部)
第一部分第 2 章第 2 节介绍了 SLM 和物理 AI。这是本文的定义、专家评论和图表的原始来源。
IBM|什么是小语言模型(SLM)?(外部)
白皮书中作为脚注引用的来源。这是确认白皮书引用日期与当前描述存在差异的依据。
首选网络|PLaMo Lite 现已上市(外部)
该白皮书引用的公告来源如图I-2-2-1。这是基准价值、4万亿代币和发展方式的基础。
EQUES|开发医药专用大规模语言模型“JPharmatron-7B”(外部)
操作环境、JPharmaBench 的 3 任务配置、要比较的 2 个模型以及 GENIAC 采用的来源。
AWL有限公司|神户诺埃维尔体育场的示威活动(外部)
这是这三家公司的组成以及演示将于 2025 年 6 月开始并计划持续到 2026 年 1 月这一事实的来源。
LLM-jp|llm-jp-eval(外部)
生成Jaster的评估平台。这是确认Jaster与GENIAC关系的基础。
Preferred Networks技术博客|PLaMo 3系列8B/31B预学习验证(外部)
白皮书引用的基准是截至2024年,这份文件表明世代将继续前进。
