本地部署大模型的坑 #本地部署 #4090 #openclaw

本地部署怎么看token消耗

226
103
92
19
举报
发布时间:2026-05-23 08:17
查看AI文稿
成路小栈
成路小栈

粉丝755获赞9182

相关视频

  • 用Mac Mini能分币不花的养龙虾吗? 用Mac Mini部署本地算力,能实现分币不花的养龙虾吗?养龙虾最大的成本token的费用,也就是算力。那现在最简单的方式就是接入阿里云 腾讯云 火山云上的大模型,你每次使用都会消耗算力,所以这是一个持续付费的过程,要是使用频繁一个月花个几千块钱买token,也是稀松平仓,然后另外一种所谓分币不花的方式呢,就是一次性投入买一个硬件,然后在里面部署一个开源的大模型,类似Kimi/千问/DeepSeek这种,为了省下token费用,我花了将近4k买了个丐版macmini,经过尝试 想分币不花的使用本地算力养龙虾基本没戏,下面我说说原因啊,我选的这个90亿参数的qwen3.5:,算是能力比较低的模型了。但要想让他发挥全力大概需要18gb显存。而我这款钙板macmini最大调动显存也就13g左右,好在Ollama这个工具可以量化压缩模型,所以勉强能跑这个千问3.5,但是因为算力不够,你随便问他一个问题,真的是等到天荒地老…时间久到你都怀疑是不是卡了。。。最后还接了云龙虾才正常运行起来。但是如果要接云模型,我就没必要新买macmini了,云模型龙虾对配置要求很低的。基本常用的笔记本电脑都能运行,完全没必要为了龙虾新买电脑,所以这个macmini算是又交了一笔AI学费#openclaw #养龙虾 #ai #大模型 #macmini
    02:19
    用Mac Mini能分币不花的养龙虾吗? 用Mac Mini部署本地算力,能实现分币不花的养龙虾吗?养龙虾最大的成本token的费用,也就是算力。那现在最简单的方式就是接入阿里云 腾讯云 火山云上的大模型,你每次使用都会消耗算力,所以这是一个持续付费的过程,要是使用频繁一个月花个几千块钱买token,也是稀松平仓,然后另外一种所谓分币不花的方式呢,就是一次性投入买一个硬件,然后在里面部署一个开源的大模型,类似Kimi/千问/DeepSeek这种,为了省下token费用,我花了将近4k买了个丐版macmini,经过尝试 想分币不花的使用本地算力养龙虾基本没戏,下面我说说原因啊,我选的这个90亿参数的qwen3.5:,算是能力比较低的模型了。但要想让他发挥全力大概需要18gb显存。而我这款钙板macmini最大调动显存也就13g左右,好在Ollama这个工具可以量化压缩模型,所以勉强能跑这个千问3.5,但是因为算力不够,你随便问他一个问题,真的是等到天荒地老…时间久到你都怀疑是不是卡了。。。最后还接了云龙虾才正常运行起来。但是如果要接云模型,我就没必要新买macmini了,云模型龙虾对配置要求很低的。基本常用的笔记本电脑都能运行,完全没必要为了龙虾新买电脑,所以这个macmini算是又交了一笔AI学费#openclaw #养龙虾 #ai #大模型 #macmini
    查看AI文稿
  • DeepSeekV4完整使用教程#DeepSeek #deepseek本地部署 #AI #教程分享
    07:03
    查看AI文稿
  • 开源推荐:CodexScope 统计本地codex本地消耗情况
#开源 #github #codex #github优质项目 #ai编程
    01:39
    查看AI文稿
  • Github宝藏级项目Agency-agents保姆级教程 Github宝藏级项目,我让我的Hermes用deepseek-v4-pro指挥184个转专业角色,帮我完成各种长任务,token消耗实测#github优质项目 #agencyagent #Hermes #openclaw #ai工具
    01:51
    查看AI文稿
  • 简单聊聊本地部署大模型和小龙虾的平台选型和运行速度#哈工老韩 #小龙虾 #openclaw #机器人
    03:05
    查看AI文稿
  • Openclaw本地部署,能否实现算力自由? #戴尔 #ai #算力 #it #科技 @挨踢研究所
    01:50
    查看AI文稿
  • 别再用OpenClaw部署本地大模型#openclaw
    01:06
    查看AI文稿
  • vLLM 解密:DeepSeek V4 本地部署为何如此困难 DeepSeek V4 本地部署,门槛直接劝退,起步就要 4 张 B200。大家好,我是 AI 学习的老章。V4 这次最狠的不是参数,是把 1M 上下文做到了极致。bf16 的 KV cache 在 1M 下,每条序列只要 9.62 GiB,比 V3.2 那种估算小了将近 9 倍。代价是注意力机制堆成了五层蛋糕。MLA 之上叠 K 和 V 共享,再叠 c4a 和 c128a 两种跨 token 压缩,再用 DSA 稀疏选 top-k,最后还要 SWA 滑动窗口保留局部信息。indexer 用 fp4,attention cache 用 fp8,又能再砍一半显存。省下来的显存全是工程债。vLLM 这一侧把逻辑块统一钉死 256 个原生 token,压缩器残差直接当 SWA 处理,所有 page size 归到三个桶,再叠三处内核融合加多流并发,才把这套机制喂进 GPU。我的判断很直白。个人用户想本地跑 V4,短期内别想了。真正能吃到红利的,是手上有 H200 和 B200 集群、又要做长文档分析和多轮 agent 工作流的 infra 团队。
    01:26
    vLLM 解密:DeepSeek V4 本地部署为何如此困难 DeepSeek V4 本地部署,门槛直接劝退,起步就要 4 张 B200。大家好,我是 AI 学习的老章。V4 这次最狠的不是参数,是把 1M 上下文做到了极致。bf16 的 KV cache 在 1M 下,每条序列只要 9.62 GiB,比 V3.2 那种估算小了将近 9 倍。代价是注意力机制堆成了五层蛋糕。MLA 之上叠 K 和 V 共享,再叠 c4a 和 c128a 两种跨 token 压缩,再用 DSA 稀疏选 top-k,最后还要 SWA 滑动窗口保留局部信息。indexer 用 fp4,attention cache 用 fp8,又能再砍一半显存。省下来的显存全是工程债。vLLM 这一侧把逻辑块统一钉死 256 个原生 token,压缩器残差直接当 SWA 处理,所有 page size 归到三个桶,再叠三处内核融合加多流并发,才把这套机制喂进 GPU。我的判断很直白。个人用户想本地跑 V4,短期内别想了。真正能吃到红利的,是手上有 H200 和 B200 集群、又要做长文档分析和多轮 agent 工作流的 infra 团队。
    查看AI文稿
  • 0成本运行小龙虾,它来喽(1) #openclaw #本地部署大模型 #显卡 #改装电脑
    02:22
    查看AI文稿
  • deepseek v4实测结果来啦,我们拿了4张pro6000本地部署了一下,测试了它的并发数,关注我,后续会继续测deepseekV4#工作站#服务器#pro6000#服务器推荐#工作站推荐
    00:45
    查看AI文稿
  • 【小白教程】Hermes本地部署,windows实操 #Hermesagent #Agent #飞书 #openclaw #本地部署
    04:08
    查看AI文稿
  • 本地AI部署生图生视频实测 30 秒极速出视频,无限 Token 随便用,再也不花钱买废片!#openclaw  #本地大模型  #macstudio  #Ai应用  #英伟达
    00:47
    查看AI文稿
  • 本地部署算力机值不值#服务器#显卡#工作站#大模型#token
    00:50
    查看AI文稿
  • AI本地部署 零Token消耗 #人工智能 #AI #大模型 #token #本地部署
    02:21
    查看AI文稿
  • deep seekv4本地部署全解析,一条视频给你讲清楚工厂 企业 个人本地部署如何选择硬件#deepseekv4#工作站#服务器#工作站推荐#国产算力
    02:47
    查看AI文稿
  • 我发现了一款免费、免安装、轻量的本地大模型部署工具 最近折腾本地大模型的时候,发现了一个挺有意思的工具:Herdsman 牧马人。 
相比我之前用过的 Ollama、LM Studio,它给我的感觉是更轻、更省事。基本免安装,打开就能用,而且会根据你电脑的硬件配置推荐合适的模型,这点对新手真的友好很多,不容易一上来就踩坑。 
速度方面也挺意外的,同样的模型在一些场景下响应会比传统方案更快,资源占用也没想象中那么高,比较适合长期挂在本地跑。 另外它支持标准 API,可以直接给其他 AI 软件或者工作流工具调用,本地算力终于不只是“聊天”用了。 
目前支持的模型也很多,像 Qwen、DeepSeek、Gemma、GPT 系列这些主流模型基本都能跑,而且会按代码、办公、知识库、日常聊天这些不同场景推荐模型,对普通用户来说确实省了不少研究时间。
#大模型 #AI #本地部署 #千问 #deepseek
    02:15
    我发现了一款免费、免安装、轻量的本地大模型部署工具 最近折腾本地大模型的时候,发现了一个挺有意思的工具:Herdsman 牧马人。
    相比我之前用过的 Ollama、LM Studio,它给我的感觉是更轻、更省事。基本免安装,打开就能用,而且会根据你电脑的硬件配置推荐合适的模型,这点对新手真的友好很多,不容易一上来就踩坑。
    速度方面也挺意外的,同样的模型在一些场景下响应会比传统方案更快,资源占用也没想象中那么高,比较适合长期挂在本地跑。 另外它支持标准 API,可以直接给其他 AI 软件或者工作流工具调用,本地算力终于不只是“聊天”用了。
    目前支持的模型也很多,像 Qwen、DeepSeek、Gemma、GPT 系列这些主流模型基本都能跑,而且会按代码、办公、知识库、日常聊天这些不同场景推荐模型,对普通用户来说确实省了不少研究时间。
    #大模型 #AI #本地部署 #千问 #deepseek
    查看AI文稿
    3078Genima