57
13
11
1
举报
发布时间:2026-05-24 08:56
查看AI文稿
炫影墨客(互关)
炫影墨客(互关)

粉丝152获赞7705

相关视频

  • 在之前的视频里有观众问我:为什么我的缓存命中率这么高?
基于这个原因我出了这期视频来分享我使用AI的一些提高缓存命中和节省token的小技巧。如果大家有更好的技巧和方法欢迎在评论区分享出来!#DeepSeek #token  #agent #ai知识分享
    01:38
    查看AI文稿
  • 为什么token计费分为输入输出和缓存命中不命中。是涉及到PD分离和kv cache两个概念。
所以华为昇腾950和英伟达vera rubin都针对PD分离做了专用型号。
#英伟达 #华为 #AI #GPU #token
    01:09
    查看AI文稿
  • DeepSeek-Reasonix 到底省多少 看看源码,DeepSeek 如何设计以确保 100% 的 cache 命中。以及用它做 Vibecoding 到底能省多少钱? #ai #oomol #vibecoding #deepseek#编程
    04:29
    查看AI文稿
  • DeepSeek写代码4.72亿Token成本实测 用DeepSeek V4 Pro在Claude Code 里写了一天代码,缓存命中很高,成本低得离谱。下一期看看它到底写出了什么工具。#deepseekv4 #deepseek #deepseek模型 #claudecode #AI编程
    00:28
    查看AI文稿
  • 教你最大化Claude Code缓存命中来节省token 之前两期讲了Prompt Cache怎么省token、breakpoint怎么命中。这期反过来讲:什么动作会让cache直接报废,怎么用才能最大化命中率。 
先给一个心法。
把每个请求想成一根从左到右的链条:tools → system → CLAUDE.md/skills → messages。改哪一段都会让cache失效,区别只在影响范围:改左边的从这段往右全部跟着废,改右边的只伤自己那一段。所以越靠左越要锁死。官方三级失效层级表(tools/system/messages)就是这个原则的精简版(CLAUDE.md严格来说在messages层,单独抽出来是因为它最常被改)。 
4个日常杀手,按它们出现在链条上的位置从左到右排:
1. 切 /model —— 最左。每个模型独立的KV cache,跨模型完全隔离。Opus跑了10万token再切Sonnet,反而比继续用Opus更贵。非要切?正解是用subagent隔出去跑(Claude Code的Explore agent就是这么干,用的Haiku)
2. 装新MCP —— tools层。装一个新MCP,tools数组就多几个工具,链条最左边一动,下面system+messages连锁失效(三层全废)。但MCP只在Claude Code启动时读一次,session内装新MCP不影响当前session——真正的杀手是 /resume 或 /reload-plugins,触发重读后tools数组重组,之前cache全丢
3. 改CLAUDE.md 或装新 skill —— messages层。CLAUDE.md 是 user 消息(052已实证),skill 列表也注入在 messages[0]——都只在启动时读一次:改完文件或装完 skill 别 /resume,否则 messages 整段重建
4. idle超过5分钟 —— TTL过期,服务器直接删条目 
每个杀手都给出怎么避免:MCP/hook 启动前一次配好;长任务前 `export ENABLE_PROMPT_CACHING_1H=1` 把 TTL 延到 1 小时。 
#claude #AI工具 #张司机 #个人开发者 #命令行
    04:17
    教你最大化Claude Code缓存命中来节省token 之前两期讲了Prompt Cache怎么省token、breakpoint怎么命中。这期反过来讲:什么动作会让cache直接报废,怎么用才能最大化命中率。
    先给一个心法。
    把每个请求想成一根从左到右的链条:tools → system → CLAUDE.md/skills → messages。改哪一段都会让cache失效,区别只在影响范围:改左边的从这段往右全部跟着废,改右边的只伤自己那一段。所以越靠左越要锁死。官方三级失效层级表(tools/system/messages)就是这个原则的精简版(CLAUDE.md严格来说在messages层,单独抽出来是因为它最常被改)。
    4个日常杀手,按它们出现在链条上的位置从左到右排:
    1. 切 /model —— 最左。每个模型独立的KV cache,跨模型完全隔离。Opus跑了10万token再切Sonnet,反而比继续用Opus更贵。非要切?正解是用subagent隔出去跑(Claude Code的Explore agent就是这么干,用的Haiku)
    2. 装新MCP —— tools层。装一个新MCP,tools数组就多几个工具,链条最左边一动,下面system+messages连锁失效(三层全废)。但MCP只在Claude Code启动时读一次,session内装新MCP不影响当前session——真正的杀手是 /resume 或 /reload-plugins,触发重读后tools数组重组,之前cache全丢
    3. 改CLAUDE.md 或装新 skill —— messages层。CLAUDE.md 是 user 消息(052已实证),skill 列表也注入在 messages[0]——都只在启动时读一次:改完文件或装完 skill 别 /resume,否则 messages 整段重建
    4. idle超过5分钟 —— TTL过期,服务器直接删条目
    每个杀手都给出怎么避免:MCP/hook 启动前一次配好;长任务前 `export ENABLE_PROMPT_CACHING_1H=1` 把 TTL 延到 1 小时。
    #claude #AI工具 #张司机 #个人开发者 #命令行
    查看AI文稿
  • 8分钟说清楚KVCache与Prompt Cache KV Cache 是什么?为什么没有它,大模型会越来越慢?
Prompt Cache 又是什么?为什么缓存命中率一高,成本就能砍到脚踝?
DeepSeek 为什么被称为"赛博善人"?某些 Token 中间商又是怎么靠缓存差价割韭菜的?
Claude Code 源码里密密麻麻写着的"缓存",到底藏着什么省钱秘籍?
    06:49
    查看AI文稿
  • Redis缓存命中率是多少?如果低于90%,怎么排查优化? #程序员 #Java #计算机 #Java面试 #创作者扶持计划
    02:16
    查看AI文稿
  • 不要被百分比的变化误导,人其实对这个不敏感。 涉及百分比的变化都要自己心算一下,否则很容易搞错。比如 CodeX/Claude Code 的缓存命中率提升几个点,都会节约很多成本。这就是为什么云计算公司要用 4 个 9 这种说法来表达可用性,而非百分比。 #ai #百分比  #codex #deepseek_reasonix
    01:35
    查看AI文稿
  • 零基础入门AI编程100讲88期: 什么是缓存? 这篇文章用生活中的水杯类比,把缓存讲成“把可能重复使用的数据放到更近更快的位置”。它不仅解释了缓存命中、未命中、TTL、LRU/LFU 等基本流程和策略,也串起了浏览器缓存、CDN、Redis、数据库缓存到 CPU 缓存等不同层级。核心逻辑是用空间换时间,减少重复读取和计算,但也要面对旧数据、一致性、穿透、击穿、雪崩等问题。看完能更系统地理解缓存为什么有用,以及设计缓存时该权衡速度、成本和准确性。。#零基础入门  #AI编程  #AI写代码  #大模型  #缓存
    07:05
    查看AI文稿
  • Claude提示词缓存 Prompt Caching算法详解 之前的视频我们介绍了Claude Code如何利用Prompt Caching节省token的。这次我们深入讲解一下Claude Code客户端在请求里明文写的cache_control标记是如何工作的。 
cache_control有两种用法。Automatic自动模式,请求顶层放一个字段,服务器自动给最后一个block打1个breakpoint,简单粗暴。Explicit明确指定,自己往block上挂,最多4个,位置自己挑。Claude Code用的是Explicit,3个breakpoint的位置全是它自己选的。3个分别标在system数组第2项末尾、第3项末尾、最新user消息末尾。前两个是稳定锚点,第3个是游标,每轮跟着最新输入往后跑。 
3条核心原理:
原理1:缓存只在breakpoint位置写,写的是从头到这里的累积prefix。所以29个tools没标cache_control也被缓存——蹭system[1]的车一起打包写进去。
原理2:读的时候在breakpoint位置查不到,往前一个block查,最多查20个。它找的是"之前写过的条目",不是"现在稳定的内容"。
原理3:20格上限。超过就放弃。 
官方博客Thariq的"Prompt Caching is Everything"分享了Claude Code围绕缓存的几个设计:分层(静态在前动态在后)、Plan Mode做成两个工具而不是swap工具集、Tool Search用defer_loading发轻量存根、compact共享原session的system+tools+history做前缀。两条提醒:不要中途切模型(缓存按模型分隔),不要中途改MCP/hook(整段前缀重来)。 
#claude #个人开发者 #命令行 #AI工具 #张司机
    06:46
    Claude提示词缓存 Prompt Caching算法详解 之前的视频我们介绍了Claude Code如何利用Prompt Caching节省token的。这次我们深入讲解一下Claude Code客户端在请求里明文写的cache_control标记是如何工作的。
    cache_control有两种用法。Automatic自动模式,请求顶层放一个字段,服务器自动给最后一个block打1个breakpoint,简单粗暴。Explicit明确指定,自己往block上挂,最多4个,位置自己挑。Claude Code用的是Explicit,3个breakpoint的位置全是它自己选的。3个分别标在system数组第2项末尾、第3项末尾、最新user消息末尾。前两个是稳定锚点,第3个是游标,每轮跟着最新输入往后跑。
    3条核心原理:
    原理1:缓存只在breakpoint位置写,写的是从头到这里的累积prefix。所以29个tools没标cache_control也被缓存——蹭system[1]的车一起打包写进去。
    原理2:读的时候在breakpoint位置查不到,往前一个block查,最多查20个。它找的是"之前写过的条目",不是"现在稳定的内容"。
    原理3:20格上限。超过就放弃。
    官方博客Thariq的"Prompt Caching is Everything"分享了Claude Code围绕缓存的几个设计:分层(静态在前动态在后)、Plan Mode做成两个工具而不是swap工具集、Tool Search用defer_loading发轻量存根、compact共享原session的system+tools+history做前缀。两条提醒:不要中途切模型(缓存按模型分隔),不要中途改MCP/hook(整段前缀重来)。
    #claude #个人开发者 #命令行 #AI工具 #张司机
    查看AI文稿
  • Deepseek对真实企业的改变大不大?看看我们一线的说法 #铜金岁月 #deepseek
    03:20
    查看AI文稿
  • C盘清理,按这个顺序处理,清出20G+空间 第一步:扫描C盘,先找出占用空间数据。 
第二步:运行 BAT 安全清理,清临时文件、更新缓存、回收站、浏览器缓存。 
第三步:查看下载、桌面、视频这些大文件,不用的删,重要的转移到D盘。
#C盘清理 #c盘清理方法 #C盘红了 #C盘爆满 #电脑清理
    02:23
    查看AI文稿
  • DeepSeek V4编程命中缓存比例高,性能强还很便宜 #deepseekV4 #大模型 #token出海 #AI编程
    04:30
    查看AI文稿
  • 大家使用中转站的时候有没有被坑? 选 AI 中转站,别只看价格。
模型注水、价格不透明、稳定性差、缓存命中差,这 4 个坑一定要提前避开。
(视频也是ai做的,可以进粉丝群一起讨论)
#token #token中转站 #codex #claudecode #deepseek
    03:07
    查看AI文稿
  • DeepSeek宣布永久降价 75%! Deepseek官宣6月起永久调整为原价的1/4。输入(缓存命中)百万token0.025元,输入(缓存未命中)3元,输出6元
#deepseek #ai训练师
    00:48
    查看AI文稿
    24