在 JANOG58 上,讨论了当前问题和下一代 BGP 操作、使用 RPKI 的路由安全、IP 地址策略以及支持生成式 AI 的高速数据中心网络。
活动第一晚,我们还参加了由Sakura Internet和Arista Networks Japan主办的“松山樱花之夜”。此次活动的主题是“AI基础设施的现实”,他从实际构建和运营生成式AI计算基础设施的角度,谈到了仅靠GPU无法解决的网络、电力、冷却、采购和运营方面的挑战。
此外,JANOG的价值不仅仅在于舞台上的展示。活动期间,我向IXP官员咨询了AS63806 Menhera®互连的问题,并与其他网络运营商讨论了在大手町数据中心使用机架的概念。我们从 JPNIC 官员那里了解到该组织在支持互联网资源管理的基础设施方面正在进行的努力。
用BGP连接网络,用RPKI验证路由的有效性,在数据中心安装设备,构建高速以太网在AI基础设施内传输大量数据。尽管它们的规模和目的不同,但它们都需要的不仅仅是逻辑设计;它们需要物理设备和连续操作。
从聆听演示的地方到交流的地方
在实地报告一中,我们介绍了JANOG58现场的体验,包括松山的氛围、会场氛围、展览、BoF、社交聚会等。
在现场报告②中,我们将讨论在那里获得的技术知识以及实际基础设施建设所取得的进展。
您稍后可以通过公开资料和存档视频查看JANOG的公告。然而,为了实现网络连接,需要与相关方做出具体安排,不仅包括技术规范,还包括连接点、线路、设备、成本、运营结构、出现故障时的联系方式等。
哪个 IXP 连接到哪个位置以及从哪个位置连接?您将使用哪些端口和线路?谁来管理数据中心内的设备?接收哪些路由以及通告哪些路由。 ROA、IRR、PeeringDB等信息如何维护?
在 JANOG,您可以将演示中获得的知识与实际设备和连接计划联系起来。
支持互联网通信的第0层是人与人之间的通信。
Yuka Mori – AS63806 生活方式信息技术研究所
从日本 BGP 运行的角度来看网络之间的连接
BGP不仅仅是最短路径搜索
- AS 和 AS 编号的基础知识
- 使用 BGP 交换路由信息
- 传输、IXP、私有对等互连
- 路线选择中反映的技术、合同和运营条件
- 路由泄漏和错误广告向外传播的可能性
- 使用 IRR 和 RPKI 进行路由过滤
BGP 并不是一种自动发现“最佳路由”的万能机制。哪些路由要优先、哪些要对外通告以及哪些信息值得信任,这些都留给每个 AS 的操作策略。
通过与 IXP 利益相关者的对话实现互连
我与某东京IX(Internet Exchange)的官员进行了现场交谈,讨论了互联的前景。有很多实际的事情要做,比如谈具体的事情、安排内部线路等。
随着连接数量的增加,配置自动化变得至关重要。我们也在继续进行这种自动化的设计。
RPKI从导入阶段进入稳定运行阶段
如何理解ROA、VRP和ROV
- ROA:指示哪些AS可以通告前缀的信息
- VRP:由ROA验证并生成的路由验证信息
- ROV:检查接收到的BGP路由和VRP的操作
- RPKI缓存服务器:聚合验证信息并将其提供给路由器的机制。
验证有效性的机制本身的可用性
在RPKI中,重要的是不仅签名信息存在,而且这些信息能够被获取、验证并稳定地提供给路由器。
因此,该计划还讨论了提高 RPKI 缓存服务器可靠性的机制。
JPNIC 政策和支持基础设施
谁创建地址策略?
IP地址和AS号的分配规则并不是简单地由JPNIC或APNIC单方面决定,而是通过社区提案和讨论形成的。
虽然该系统的成熟性提高了其稳定性,但仍存在一些问题,使得现行规则建立背后的背景以及参与政策制定过程的知识难以传递。
推动资源管理的信息系统
虽然IP地址和AS号是机构信息,但需要实际的系统来管理它们。
- 资源申请与分配
- 注册信息管理
- 认证
- WHOIS・RDAP
- 内部收益率
- RPKI
- 与指定经营者进行信息交换
- 查询及疑难解答
JPNIC 官员的最新消息
JPNIC 长期以来一直使用 JIS 编码进行 Whois 响应,但似乎他们将逐渐切换到以 UTF-8 进行响应。这需要仔细的过渡,并且需要一年的时间。
JANOG58 讨论人工智能基础设施网络
人工智能带来的通信需求不仅仅是一种。
- 训练数据的收集和传输
- 分布式学习中的 GPU 间通信
- 与存储的通信
- 推理请求和响应
- 模型和检查点的分布
- 数据中心间通信
- AI 服务与外部互联网的通信
学习期间的集中高容量通信和推理期间的连续分布式通信都很重要。
分层查看AI基础设施网络
- GPU与计算节点之间
- 机架内部
- 数据中心结构
- 存储网络
- 数据中心间连接
- 互联网连接
BGP 连接的外部网络和 GPU 集群内部的以太网有着不同的用途。然而,为了运营整个人工智能服务,有必要将它们视为一个连续的系统。
《樱花之夜》中讲述的人工智能基础设施的现实
JANOG58第一晚举办了“松山樱花之夜”。在与 JANOG58 联合举办的活动中,Sakura Internet 和 Arista Networks Japan 的官员举办了“Ask Us Anything:AI 基础设施的现实”活动。
这次活动没有直播,部分内容也没有公开,所以我只能说我听到了很多真实的故事。
与JANOG主线故事的差异
JANOG 的主要演讲是围绕既定主题和材料进行的,而“Ask Us Anything”则通过演讲者之间的对话和观众提出的问题对运营问题进行了更坦诚的讨论。
- 人工智能基础设施所需的以太网速度
- 在 InfiniBand 和以太网之间进行选择
- GPU集群大小
- 东西交通
- 罗CEv2
- 如何避免帕克罗斯
- 光端机及布线
- 设备和材料的采购(特别是是否采用供应商推荐的配置)
- 电源和冷却
- 故障隔离
- 需要人力资源
- 实际运行后发现的问题
这不仅仅是“准备一个高速端口”那么简单
本节的中心思想是,仅通过将端口速度提高到 100GbE、400GbE 和 800GbE 无法完成 AI 基础设施网络。
为了有效地运行大量 GPU,需要设计通信模式、交换机配置、拥塞控制、布线、光学组件、电源、冷却、监控和更换系统。
机架级 GPU 将机架内的大量 GPU 和计算节点作为统一系统进行操作。
因此,网络延迟、带宽、丢包、链路故障等不仅影响通信质量,还影响整个计算基础设施的性能和可用性。
物理限制随着速度的增加而增加
- 端口密度
- 突破
- 光收发器
- 电缆长度
- 弯曲半径
- 消费电力
- 发烧
- 前向纠错
- 链接瓣
- 收发器兼容性
- 交换用部材
- 布线工作难度
具体的以太网速度和配置将与JANOG58和“Sakura no Yube”上实际所说的一致。
有了高速以太网,以太网部分也可以用同样的方式来完成,但除了交换机的逻辑设置之外,光纤、连接器、收发器和配电板也是系统的一部分。
随着速度和密度的增加,物理层中的小问题可能会成为主要障碍。
AS63806:大手町 PoP
- 众多网商云集
- 连接 IXP 和公交的候选者
- 互连选项
- 与其他操作员共享设备
- AS63806 东京基地
等等这就是为什么这很重要。
AS63806 国立生活信息技术研究所也已准备好员工ID卡,并准备进入数据中心和其他设施。
小型AS也是互联网的成员。
AS63806并未建设与大型AI云运营商同等规模的基础设施。
尽管如此,只要你向外界发布BGP路由并与IXP和中转连接,你就需要负责路由管理、RPKI、故障响应、安全、物理设备和通信系统。
小型网络可以从大规模人工智能基础设施的讨论中学习一些原则。
- 不只看速度,更看可操作性
- 了解单点故障
- 避免过多分离逻辑和物理设计
- 创建可以检测、隔离故障并从故障中恢复的配置
- 不仅要准备设备,还要准备更换零件和工作系统。
- 选择适合您的人员和预算的可持续设计
[编者后记]
在JANOG58和“松山樱花之夜”上,我听到了与BGP、RPKI、AI基础设施和高速以太网相关的操作问题,这些问题仅从演示材料中很难看到。
与此同时,与IXP官员就互联问题进行磋商、讨论大手町数据中心机架的使用以及从JPNIC官员收集有关基础设施的信息等方面取得了进展。
并非所有事情都是当场决定的。然而,AS63806 方面与谁联系、检查什么以及需要做什么准备现在比以前更加具体。
BGP 是一种用于在网络之间交换路由的协议。 RPKI是一种验证路由发布权限的机制。高速以太网在AI计算基础设施内部承载大量数据。
但支持这些技术的不仅仅是路由器和交换机。当来自不同组织的操作员会面、审查条件和问题并建立关系时,就会创建新的连接和基础设施,使他们即使在发生故障时也能一起工作。
我们能否将在松山开始的对话连接到实际的机架、线路、路由器和 BGP 会话?当地报告的真实延续情况将在未来的建设和运营中变得清晰。
