全站搜索

最新动态

COMPANY NEWS

从“排队抢卡”到“按需调度”,软硬一体方案激活高校算力价值

最新动态 23390

前面我们聊了大模型私有化部署为何成为越来越多高校和科研院所的选择。今天我们就来看一个具体的案例,一所高校如何把算力真正用起来。

这所学校在内蒙古,主攻能源与动力方向,研究风能、火力发电、氢能等领域,都是需要大量算力支撑的大课题。课题大,模型就大,数据就多,训练任务就重,对算力的需求来得又急又猛。

图片

01科研与教学,撞上同一堵墙

搞科研的导师要训练模型,一跑就是几小时。上课的学生也要跑任务,作业、实验、课程项目,一样离不开算力。但机器只有一台,想用上算力就得排队,你用完我再用,白天抢晚上抢,资源利用率上不去,教学节奏也被拖住。

为什么会出现这样的局面?拆开看,是三个层面的问题。

科研层面,深度学习模型训练、仿真计算等任务,对高性能算力提出刚性需求。

教学层面,多用户并发使用,资源争抢频繁。

管理层面,算力设备与教学场地分离,师生往返成本高,运维压力大。

问题摆在这里,怎么解?

02算力切分与统一调度

精细高效的智算底座

融科联创给出的答案,是天枢推算存管用局端智算一体机,一台软硬一体化的国产智算一体机。

它是融科联创三端协同全栈系列场景AI本地部署解决方案中局域端的核心,与边缘端、中心端协同联动,共同构成从算力到场景到应用的完整链路。

图片

思路很直接,算力用不完,就切开分着用。

一台八卡机器,按一比三切分,变成24卡。每位学生分到8G显存,足够在课堂上跑训练任务。一块显卡,掰成三份用。

切开不是简单粗暴地平分。平台用弹性资源调度算法和容器化隔离技术,把CPU、GPU、内存全部做精细化切分和动态调配。科研任务要的算力多,多分一点。教学任务要得少,少分一点。谁用多少,系统自己会算。

多用户使用模式下,资源有配额管理,算力隔离、公平共享。你跑你的,我跑我的,互不干扰,谁也不抢谁的卡。

算力切分只是第一步。让师生用得顺手的,还有两件事。

第一件事,是距离。机器放在机房,教室离得远,以前学生要跑实验室才能用,来回折腾,人累机器也闲置。现在平台支持远程访问,学生人在教室,算力在机房,中间只隔着一根网线。

第二件事,是操作。平台把命令行那套复杂的东西全藏起来了,Web端可视化界面,集群管理、作业调度、监控告警、用户权限,都在一个页面里。向导式流程引导,点几下就能提交作业。界面还能自定义工作台、放常用功能的快捷入口,对不熟悉高性能计算的学生特别友好。

管理员的体验也顺了。图形化仪表盘把集群各节点的运行状态摆得明明白白,算力使用率、内存占用、网络IO、存储负载,一眼扫过去心里有数。异常节点自动高亮预警,历史数据随时回溯,容量规划有据可依。

03方案落地,科研教学双提速

方案落地,变化是看得见的。

科研训练效率提升了三成以上,学院在能源与动力工程方向的课题推进明显提速。教学和训练真正绑在了一起,学生课堂上就能实操,学完理论马上上手跑任务。算力不再是你争我抢的资源,二十多个学生同时在线,各用各的,互不打扰。

这个案例的价值,不在多了一台机器,而在换了一种用算力的方式。

算力切分,只是融科联创三端协同方案里的一环。边缘端、局域端、中心端协同联动,把从算力到场景到应用的整条链路打通,才是这套方案的真正分量。学校买到的,不是一台冷冰冰的设备,而是一套能让算力真正转起来的能力。

图片

而这背后,是融科联创十四年智能计算积累、三千多家行业客户沉淀出的解法。把AI请进家门只是开始,让它真正用起来,才算结束。

上一篇: 下一篇: