上海科仿信息科技有限公司将多个云的资源整合成统一的独享计算资源池,用户无需任何初始采购成本,最低只需10分钟即可拥有媲美全球超算 Top500 的超级算力。为有高算力需求的企业提供一站式解决方案。
科仿HPC-ALL IN一体化平台构建采用Sangfor的桌面解决方案,不仅可以解决PC桌面面临的各种难题,还能优化可用性、可管理性、总体拥有成本和灵活性。借助Sangfor科仿HPC-ALL IN一体化平台,在使用VMP(虚拟化管理平台)的服务器上运行的虚拟机中,可以构建完整的桌面环境-操作系统、应用程序和配置。管理员可使用 集中管理环境中的所有虚拟机。最终用户可使用远程显示软件,从PC或瘦客户端(aDesk)访问其桌面环境。
科仿HPC-ALL IN一体化平台可为每位用户提供一个独立的虚拟机来进行桌面计算。通过为每位用户提供自己的操作系统, 提供了企业部署集中式桌面所需的稳定性和性能管理功能。
VMP是一个桌面虚拟化解决方案,它与 VDC(虚拟桌面接入管理系统)协同工作,可提供一个完整的端到端 View桌面虚拟化解决方案,此解决方案不仅能增强控制能力和可管理性,简化虚拟桌面的管理、调配和部署;还可以提供令用户备感亲切的桌面体验,用户能够通过“aDesk”安全而方便地访问虚拟桌面,升级和修补工作都从单个控制台集中进行,因此可以有效地管理数百甚至数千个桌面,从而节约时间和资源。数据、信息和知识财产将保留在数据中心内。
1 科仿HPC-ALL IN一体化平台 HPC/CAE云计算中心建设目标、策略及步骤
科仿HPC-ALL IN一体化平台在2020年已经建立了首批的HPC计算中心,目前系统运行状况良好,总核数2000核,运行软件包括:碰撞安全,结构nvh耐久疲劳,空气动力学等多个学科。
通过项目的分批次建设,未来将实现一个统一整合的研发仿真设计云平台,通过平台的上线实现如下功能
¡ 平台及资源整合
新购计算平台之中,由一个统一的、集成的平台软件来管理,形成一个可扩展,可管理,可动态扩充的资源池,以整合所有的计算资源、实现整个科仿HPC-ALL IN一体化平台资源的有效整合和充分共享,于此同时,需充分保护在原有软硬件的投资,并充分利用在原有平台建设上取得的成果、获得的成功的经验,在此基础上对整个平台进行架构和功能的升级与增强,打造一个满足科仿HPC-ALL IN一体化平台研发需要的、技术领先的HPC平台。
n license整合:license在企业的研发投入占到了比较大的比重,如何利用现有license,优化现有license是优化整合企业仿真计算平台非常重要的一环,建议整合license步骤如下:
u 保留node-lock license在原购买机构,并争取从厂商升级为浮动license;
u 合并所有相同软件license授权;
u 整合所有相同软件浮动license到集团中心IT部门;
u 监控license使用效率,根据实际使用率和使用效率进行优化和增减;
¡ 系统功能优化
当前平台提供了一个集成的、单一的入口,系统地提供了用户、计算资源、设计及分析应用、系统状态、统计记账等方面的资源和服务。其模块分为:主页、云用户、云资源、云应用、云能力、统计计费。
可以优化和增强的地方包括:
用户认证和授权:可以和当前科仿HPC-ALL IN一体化平台的Windows Active Directories 域进行更紧密的集成,即平台能自动将用户的身份和Windows Active Directories进行校验,以验证该用户的信息、并根据其角色和平台策略自动确定其权限,用户相关的信息,如所在部门、职位等均可自动获取,无需在平台用户管理模块中再单独维护一个用户的数据库;
资源监控:资源监控可加入预警功能,如许可证服务器宕机、网络阻塞、许可证过期等预警,对存储资源、节点等均可增加预警功能,从而给平台维护者及时提供信息,采取及时的干预措施,确保平台的平稳运行;同时,资源监控可在首页提供更加直观、整合了更多信息的自定义的仪表盘,集中显示当前平台的运行状况;
统计计费:统计计费的方式可以更灵活,比如根据时段、根据使用的硬件的性能、软件的成本来灵活设置计费标准;
¡ 分步引进新技术、提供新服务
新的平台除了引进最新的硬件、存储等方面的技术外,为提供更领先、更稳健、更广泛的服务,可考虑在平台分步引进一些新的技术、提供一些新的服务:
CAE数据可视化:在平台中,对于多数的通用数据可实现可视化,如PDF、HTML、图片、视频、动画、文本文件可在线编辑等;
CAE结果远程可视化:CAE结果通常很大,不适合在网络间频繁移动,可以考虑采用最新技术,对CAE的计算结果,无需后处理,可以在平台中抽取关键的结果,如曲线、动画、云图等进行CAE结果的可视化操作;
CAE分析项目管理:可以定义一系列型号任务或项目,并将相关的资源使用和该型号研发任务或项目联系起来,从而对项目的开销实现更加精确的把握;
图形节点供应(provisioning)与调度(scheduling): 未来用户可以透过平台,透明地请求和使用图形节点及其上的应用程序,平台可以根据这些节点的负载及其上的应用程序,自动安装相关应用、准备相关图形节点,在多个用户之间进行图形节点的分配和调度;
数据的组织和管理:允许平台用户对属于自己的存储空间进行灵活的组织和管理;
最佳流程分享:在平台上共享成熟的分析、设计流程,引导用户基于web,快速、高效地完成成熟的分析或设计流程,从而实现知识的传承、传播和固化。
1.1 建设目标与策略
² 以有力支撑科仿HPC-ALL IN一体化平台CAE业务为中心目标,不断拓展服务能力、服务水平、服务种类及服务范围。
² 兼顾投资回报率、用户生产率、IT管控力
² 长远规划,注重先进性、可扩展性、兼容性
² 培育、管理和发展互利的战略合作伙伴关系
在避免被特定厂商绑架的同时,要遴选、培训和技术领先、服务体系完备、技术支持到位的厂家的战略合作关系,开展在产品采购、服务提供、技术咨询、定制开发等方面的合作,形成并保持长期稳定的合作关系,实现彼此促进,互利互惠,实现双赢的战略愿景。
² 培养专业人才,实现基础设施运营水平、IT服务能力的持续改善
HPC云计算平台涉及的技术领域广泛,是电子技术、信息技术、CAE技术密集且发展迅猛的领域;同时HPC及云计算平台在未来相当长一段时间内,都会是虚拟产品研发必不可少、深度依赖的关键业务系统,因此培育自身的技术力量,形成一个技术全面、稳定发展的技术团队,并为其提供广泛的发展机会,对形成科仿HPC-ALL IN一体化平台研发系统的核心竞争力至关重要;同时,HPC云计算平台投资巨大,服务对象多,业务重要性高,因此只有拥有一个专业的、技术水平高的团队,才能实现资产的良好运作和持续改善。
² 打造同行业最先进的HPC/CAE云计算平台,为科仿HPC-ALL IN一体化平台及其供应链提供强大的、协同的虚拟仿真技术平台
科仿HPC-ALL IN一体化平台建设的目标,必须在关键的技术领域成为行业领头羊,HPC云计算平台作为研发系统中最重要的支撑平台之一,其承载支撑能力,很大程度上决定了科仿HPC-ALL IN一体化平台虚拟协同研发能力、研发流程竞争力。通过平台的不断建设和运营,在满足科仿HPC-ALL IN一体化平台本身全仿真生命周期的支持的同时,覆盖科仿HPC-ALL IN一体化平台供应链。
1.2 建设步骤
本着长远规划、科学部署、稳步推进的原则,科仿HPC-ALL IN一体化平台 HPC/CAE云计算平台建设的步骤如下:
² 整合现有资源、建立良好技术框架、确立正确的资源分享策略、明晰平台建设的目标和步骤(1、需整合运营数据 2、需收集理解业务需求)
HPC/CAE云计算平台的建设,必须立足实际业务需要,透彻分析现有配置与应用情况,在此基础上,整合现有资源,建立良好的技术框架,再通过必要的工具和手段,对运行情况、业务需求变化等做持续的观察和分析,然后在此基础上,按照平台建设的策略和步骤,稳健推进。
² 密切联系业务部门,不断洞察真实业务需求、真实运行情况,制定服务指标,持续提高服务水平,并基于运行情况及业务规划发展计划,做好HPC/CAE云平台战略规划,做到未雨绸缪,在业务需要时能及时扩充资源,并确保业务的连续性。
HPC/CAE云计算平台首期建设完成后,在密切观察、分析平台真实运行情况的同时,需特别注意密切联系业务部门,理解业务需求及趋势,吸取用户的意见和建议,做好平台改进、改善、扬弃、扩容等工作。同时,IT部门可依赖平台相关技术手段,在和业务部门密切沟通的基础上,逐步建立双方认可的服务标准,如基于应用的等待时间、周转时间等,不断提高用户的满意度和生产率。
² 拓展平台服务种类,从提高单纯计算服务,拓展到更多CAE服务,如远程大数据处理、自动化报告生成等。
HPC平台在制造业的应用,和CAE密切相关,正在不断加强和CAE工作的集成,随着云计算计算的发展,HPC平台开始覆盖越来越多的CAE工作流程,从而演变为企业CAE云平台,从其提供的服务来看,其发展趋势如下:
HPC(单纯提供批处理计算服务)
+交互调试支持(非大型OpenGL程序)、优化作业、DOE作业提交支持
+数据可视化、结果可视化
+应用:前后处理、优化、数值处理、自动/手工报告
+CAE数据管理、企业材料库、模型库、工况库等
=HPC/CAE云计算中心
由上可以看出,HPC/CAE紧密结合,不断相互渗透。因此科仿HPC-ALL IN一体化平台在考虑HPC平台建设时,切忌将其看做一个工具或是一个计算平台,而是要充分考虑到CAE业务流程和HPC平台提供的服务的这两方面相互渗透的趋势,在建设HPC平台时,除了关注CAE部分的业务需求,更要发挥HPC平台对CAE的支撑作用,通过在HPC平台引进新技术提供新服务,不断拓展HPC/CAE云平台对CAE全生命周期的支撑作用,将其打造成虚拟仿真开发平台。
² 提高服务能力,覆盖整个科仿HPC-ALL IN一体化平台研发工程部门,辐射供应链,树立电子行业云计算平台标杆
立足平台服务能力及服务水平,充分利用科仿HPC-ALL IN一体化平台平台运作的经验和能力,将平台的能力和服务交付到更多科仿HPC-ALL IN一体化平台工程部门、试验部分、制造部门及设计部门,充分发挥CAE在产品设计中的创新作用。
与此同时,为更好整合供应链,提高供应链的协同能力,可将平台辐射到整个供应链,为下游厂家提供协作的平台和相关的服务。
在此过程要求科仿HPC-ALL IN一体化平台逐步建立自身的技术支持队伍,包括平台维护团队、技术开发团队、CAE支持团队,真正拥有自身的云计算和CAE核心能力。
1.3 建设阶段
阶段一(初步建立仿真管理云平台):HPC系统平台初建,目标整合长春软硬件资源,并对相关系统提供优化的硬件平台,以实现软件的利用效率最大化,所有的并行计算和高价值license和高价值服务器硬件进行统一整合及统一管理,所有工程师通过企业内部高速网络进行相关的软件系统使用;
阶段二(系统优化及整合):增加相关统计分析模块,对系统的使用瓶颈进行分析,并对系统进行优化,增加瓶颈资源,以实现对研发项目重点保证,和各类数据管理平台进行整合;实现企业数据管理平台各类工况库,模型库,材料库的建立和完善。
阶段三(基于云平台的统一仿真及设计平台):最终实现统一的云计算整合平台,实现所有相关软件的统一管理,动态扩展,多地资源负载均衡,完成多个技术中心的软件资源分布式共享,即可满足本地需求,又可以在多个研发中心之间进行资源和合理动态分配,所有的工程师通过云进行所有的CAD,CAE设计和仿真工作。
2 面向高性能计算中心的资源管理、作业调度系统方案
2.1 基于应用的场景分析
2.1.1 终端用户通过PBS Access,提交Fluent批处理计算作业
步骤如下:
用户登录Access提交的用户名、密码是该系统的用户名和密码,系统可以根据客户的政策进行相应的用户校验,比如自动提取当前工作站当前会话的用户证书,并和证书中心校核等。
登录界面
用户登录系统后,选择Fluent,上传文件,或从远程存储拖曳文件,作为计算输入,即可成功提交Fluent作业,如下图所示:
提交仿真计算作业
作业在计算过程中,随时可察看其趋势曲线:
基于web即时查看计算趋势
用户也可随时启动fluent,并载入模型进行修改,并重新开始提交作业:
基于web启动流体计算软件调试作业