X / Twitter2 条

DeepSeek 模型与训练引擎

DeepSeek 的模型发布、训练基础设施与硬件动态:@Priyannkaaaa 称 DeepSeek V5 泄露,由 120 亿美元战备资金支持——获腾讯和宁德时代超 120 亿美元,超过原 75 亿目标;资金用于算力扩张、模型开发和 2027 IPO;计划在内蒙古新数据中心部署 16 万+ 华为昇腾加速器;V5 将是首个主要用国产华为芯片而非 Nvidia 训练的模型;传闻 V5 最早下月发布(未证实);芯片分配约 80% 训练 / 20% 推理。@Rahmanbarik 称 DeepSeek 发布 DeepGEMM,最多可节省 98% token,用于 GPT Astra 和 Opus 5.5——DeepGEMM 是 DeepSeek 训练和运行自家模型的引擎,更快 GPU 数学运算→每 GPU 更多 token→更便宜 token,可将该引擎插入自己的模型在已有 GPU 上挤出更多每秒 token,速度上匹配或超越专家调优的 GPU 库,称费用从 $50 降至 $1.6。(当前 2 条)

@Rahmanbarik

@Rahmanbarik 称 DeepSeek 发布 DeepGEMM,最多可节省 98% token,用于 GPT Astra 和 Opus 5.5。

X / Twitter查看原文 →

数据由 GitHub Actions 每小时自动抓取 · AI 摘要聚合 · News Monitor