大模型与智能体DeepSeek-V4.1-FlashDeepSeek-V4.1-Flash发布:552B MoE以非对称架构压缩KV缓存成本
DeepSeek发布V4.1-Flash,采用552B参数MoE和因输入、输出阶段而异的激活规模,官方称KV缓存的显存与SSD需求显著下降。
大模型与智能体DeepSeek-V4.1-FlashDeepSeek发布V4.1-Flash,采用552B参数MoE和因输入、输出阶段而异的激活规模,官方称KV缓存的显存与SSD需求显著下降。
沐曦与密瓜智能宣布完成llm-d适配,将国产GPU接入围绕Kubernetes构建的分布式大模型推理组件体系。
大模型与智能体腾讯混元腾讯发布并开源Hy4 preview,总参数770B、激活参数49B,上下文超过100万Token,面向代码、办公和科研生产力任务。
沐曦宣布曦云C系列GPU完成智谱GLM-5.3 Day-0适配,显示国产算力平台开始把新模型首发适配速度作为生态竞争指标。
部署操作看教程,技术结论回到原始文档核对。
模型部署、推理优化、集群运维与故障处理。
集群运维与排障AMD ROCm使用AMD验证的ROCm PyTorch容器建立GPU环境,解释/dev/kfd、/dev/dri、HIP版本、设备权限和多卡验证,并避免把CUDA教程直接套到AMD平台。
集群运维与排障Kubernetes GPU从GPU节点驱动和设备插件开始,让Kubernetes上报nvidia.com/gpu或amd.com/gpu,编写最小测试Pod,并根据事件定位资源为零、Pod Pending和异构卡误调度。
集群运维与排障DCGM Exporter在每个GPU节点部署DCGM Exporter,通过9400端口输出Prometheus指标,解释温度、功耗、显存、PCIe、Xid和健康指标,并设计避免告警噪声的规则。
官方文档、模型技术报告、架构白皮书与兼容说明。
官方技术文档AI算力AI推理监控容易因模型、租户和请求标签产生高基数,必须在接入阶段约束指标设计,本文整理阅读顺序、工程重点和验证方法。
官方技术文档AI算力vLLM参数会同时影响模型能否加载、KV缓存容量、并发吞吐和接口兼容性,本文整理阅读顺序、工程重点和验证方法。
官方技术文档AI算力Transformers文档覆盖模型加载、device map、低精度、缓存和自定义代码,本文整理阅读顺序、工程重点和验证方法。
从业务目标、硬件配置到模拟压测与整改结论。
查看全部案例 →
模型部署方案AI算力120名坐席处理政策咨询与工单摘要,模型只提供建议,不直接向市民自动发送答复。文章给出配置、负载、模拟验收数据、实施步骤和风险边界。
企业私有化方案AI算力80名研发人员检索论文、专利和内部实验报告,要求回答定位到原文页码与图表。文章给出配置、负载、模拟验收数据、实施步骤和风险边界。
性能实测方法AI算力600家门店按商品预测未来14天销量,为补货提供建议但保留人工调整。文章给出配置、负载、模拟验收数据、实施步骤和风险边界。
网昱可以继续完成GPU与模型选型复核、AI服务器配置、私有化部署、采购交付和算力资源匹配。