X / Twitter5 条

LLM 成本优化与推理加速

通过路由、缓存、加速与本地化降低大模型算力成本:@Promixyz 列 10 个开源仓库(LiteLLM、RouteLLM、Martian、GPTCache、LMCache、SGLang、vLLM、llama.cpp、bitsandbytes、OpenLLMetry);@atomic_chat_hq 展示本地 Liquid d1 3B 在 RTX 3090 上 8ms 决策击败 OpenAI API(345ms);另一条展示本地 Laya 在 M5 Max 上每链接 34ms 击败云端模型。

@atomic_chat_hq

@atomic_chat_hq 称本地 Laya 在 M5 Max 上运行击败 OpenAI 决策 API,在网页链接提取任务中每链接 34ms,比云端模型多检查 3 倍。

X / Twitter查看原文 →

@Promixyz

@Promixyz 列出 10 个开源 GitHub 仓库,让 GPT 6 Astra 花更少算力而不变笨。

X / Twitter查看原文 →

@razeden0

@razeden0 讲述在 Claude + Grok 4.7 + Jev 中放入网络爬虫,读取 1860 页并省下 81 美元。

X / Twitter查看原文 →

@Rahmanbarik

@Rahmanbarik 称 DeepSeek 发布 DeepGEMM,最多可节省 98% token,用于 GPT Astra 和 Opus 5.5。

X / Twitter查看原文 →

数据由 GitHub Actions 每小时自动抓取 · AI 摘要聚合 · News Monitor