支持多种业务场景的解决方案

点击各项可链接至详情

1

高速交换机

我国正处于人工智能与智算中心建设的爆发期,在推进大规模算力网络部署的过程中,面临着传统网络带宽瓶颈、高并发数据拥塞、算力孤岛以及数据传输效率低下等问题。这些痛点严重阻碍了AI大模型训练与智算产业的快速发展。

近年来,针对智算网络的发展现状,蓝蛛科技依托新一代400G/800G/1.6T高速交换芯片,自研了面向各级智算中心与云服务商超高带宽、极低时延、无损传输的数据交换的高速交换机,实现算力资源的无缝互联与高效协同;助力AI企业和科研机构海量数据高速吞吐与分布式训练加速,加速现代智算产业全面升级。

• 蓝蛛科技解决方案目标:

1.整体提升智算中心网络的高吞吐、低时延、智能化管理与运维水平;

2.彻底消除网络拥塞与丢包瓶颈,保障AI大模型训练推理的高效与稳定运行;

3.掌握第一手的网络流量与算力调度数据,洞察智算网络运行态势,优化架构科学决策;

4.整合算力与网络资源,构建高性能智算高速互联底座,形成数据与算力的高效共享机制,实现全局集中管理与协同计算。

2

交换机操作系统

传统的封闭式、黑盒式网络操作系统已经不能满足现代智算中心与AI大模型对网络高并发、低时延、灵活调度的发展需要。在前沿科技领域,有一种新型的网络架构称为开放网络(Open Networking),这种网络方式的最大特点是不受单一厂商硬件绑定,可以在标准化的白盒交换机上按照用户事先设计的方式运行定制化的操作系统(NOS),从而取得高效、灵活、低成本的效果。近几年,智能NOS与开放网络发展迅猛,已成为智算网络发展的一大趋势。

近年来,针对智算中心网络的发展现状,蓝蛛科技借助新一代AI与自动化技术,对交换机操作系统(NOS)进行深度定制和智能管控。以AI智算集群为例,NOS监控与管控项目包括:端口流量、队列拥塞状况、光模块状态、路由转发效率、RoCEv2无损网络参数、ECN标记阈值、PFC死锁检测、以及微突发遥测数据(Telemetry)采集等;外部协同项目包括与SDN控制器联动、AI算力调度平台对接、自动化运维脚本执行等。智能NOS的大数据应用给网络管理者带来了显著的经济效益,提高了网络利用率,减轻了运维工作量,同时也为AI大模型训练带来了巨大方便。

• 相比传统的封闭网络系统,蓝蛛科技智能NOS解决方案具有以下优势与目标:

1.部署和维护简单(支持自动化配置与容器化部署),软硬件解耦使成本完全可控;

2.掌握第一手的网络遥测数据,科学决策(如智能拥塞控制),提高网络吞吐量,大幅减轻技术管理工作量;

3.整合资源,形成智算网络NOS大数据中心,形成信息共享与自动化运维机制,实现网络全局状态的集中管理与协同调度。

3

智算芯片与算力卡互联

· 传统通用计算市场将彻底变革,因为智算芯片与算力卡的作用超越了传统的通用数据处理和简单逻辑运算,成为AI大模型训练、复杂智能推理和算力革新的关键推动力。

· 蓝蛛创新的智算芯片与算力卡互联技术让AI算力底座强大起来,可以有效支撑大模型分布式训练以及算力动态调度、显存带宽优化、异构计算加速、模型推理加速、高并发数据吞吐、低功耗智能控制、算力节点实时监测、能效比统计、芯片核心温度监控、算力集群异常告警、全集群算力统筹管理等。

4

无损网络与网络运维

• 传统智算网络难点与不足:

a.智算中心网络拓扑极其复杂,超大规模集群的流量调度与拥塞控制困难

b.AI大模型训练产生的微突发流量巨大,传统网络架构难以应对,极易导致网络拥塞与丢包

c.网络性能瓶颈和故障隐患具有隐蔽性,在时间和空间上随机性大,难以预测

d.缺乏全局网络可视性,故障排查依赖人工抓包,运维效率低且成本高昂

e.传统网络设备缺乏细粒度遥测能力,无法保障AI训练所需的绝对无损传输环境

f.依靠离线日志分析,很难及时、可靠地捕捉到网络死锁、丢包或性能劣化事件

• 蓝蛛科技提出的无损网络与智能运维解决方案具有:

1.智能无损网络架构,采用先进的RoCEv2协议与动态拥塞控制算法,实现AI算力传输的零丢包

2.深度网络遥测技术(INT/Telemetry),具备微秒级流量可视、队列深度监测以及链路状态精准感知能力

3.AIOps智能运维系统,结合AI算法进行流量预测与故障自愈,具备全天候、自动化的网络健康保障能力

4.自动化编排与管控,支持网络策略一键下发与集中式管理,便于快速部署和极简维护

5.实时网络预警,全量在线数据采集,大数据根因分析及网络异常实时预警,全力保障智算业务的连续性

5

智算基础设施集成

· 创新是人工智能与算力产业的核心,其主要发展方向:算力规模化、绿色低碳、架构优化以及资源弹性调度。传统模式下,企业依靠分散的IT设备和传统机房来支撑业务。近些年虽然通用云计算有所普及,但面对AI大模型训练与推理的爆发式需求,传统IT架构在算力密度、网络互联带宽、以及整体能效比(PUE)等方面都存在严重的局限性。

· 蓝蛛科技智算基础设施集成解决方案可以确保从底层硬件(算力服务器、高速网络、存储)到上层软件(智能NOS、算力调度平台)的一站式无缝交付,实现算力资源的实时调度、高效协同、集中分析与智能化管理。

· 传统IT架构向现代化智算中心全面升级,提高整体算力效能与自动化运维水平(如传统机房向高密度智算集群升级、网络架构向400G/800G无损互联升级,以及全栈基础设施的集中监控与AIOps智能运维等)。