30
4
12
4
举报
发布时间:2026-05-14 07:43
查看AI文稿
戚向北
戚向北
认证徽章

粉丝7453获赞19.1万

相关视频

  • Gemma4 26B本地模型能力挑战测试 测试挑战一:自动搜索并下载图片
#hermes #hermes爱马仕 #gemma4 #本地部署
    02:04
    查看AI文稿
  • Claudecode如何接入本地大模型 claude接入本地千问/gemma本地大模型,保姆级教程。
#claude #本地大模型 #ai #大模型
    05:05
    查看AI文稿
  • 开源大模型榜单,10个主流Benchmark一次讲清 这些Benchmark可以分五个维度来理解,今天一次讲清楚 
第一个维度,代码工程能力 
SWE-bench Verified,把AI当程序员扔进真实开源项目
 让它自己读Issue、改代码、跑单元测试,真修好bug才算分
 目前最强是DeepSeek-V4-Pro
 SWE-bench Pro更难,平均一个补丁要改100行以上、跨多个文件 
第二个维度,综合知识加推理 
GPQA Diamond是博士级生物物理化学考题,联网搜都搜不到答案
 HLE被称为人类最后一卷,前沿模型现在才过40%,Kimi-K2.6目前最强
 MMLU-Pro是研究生综合考试,带思维链才能多提20%的分 
第三个维度,数学推理 
AIME是高中数学奥赛级别,每道题需要5到10步推理
 现在顶级LLM已经能做到95%,是AI数学能力飞速进步最直接的证据
 HMMT比AIME还难一档,只刷AIME不刷HMMT的模型要警惕 
第四个维度,Agent实战 
Terminal-Bench在真实Linux终端里跑工程任务
 编译Linux内核、配TLS证书、调试并发bug,全是真实场景
 这类benchmark才是AI能不能真正上手用的核心标准
    01:50
    开源大模型榜单,10个主流Benchmark一次讲清 这些Benchmark可以分五个维度来理解,今天一次讲清楚
    第一个维度,代码工程能力
    SWE-bench Verified,把AI当程序员扔进真实开源项目
    让它自己读Issue、改代码、跑单元测试,真修好bug才算分
    目前最强是DeepSeek-V4-Pro
    SWE-bench Pro更难,平均一个补丁要改100行以上、跨多个文件
    第二个维度,综合知识加推理
    GPQA Diamond是博士级生物物理化学考题,联网搜都搜不到答案
    HLE被称为人类最后一卷,前沿模型现在才过40%,Kimi-K2.6目前最强
    MMLU-Pro是研究生综合考试,带思维链才能多提20%的分
    第三个维度,数学推理
    AIME是高中数学奥赛级别,每道题需要5到10步推理
    现在顶级LLM已经能做到95%,是AI数学能力飞速进步最直接的证据
    HMMT比AIME还难一档,只刷AIME不刷HMMT的模型要警惕
    第四个维度,Agent实战
    Terminal-Bench在真实Linux终端里跑工程任务
    编译Linux内核、配TLS证书、调试并发bug,全是真实场景
    这类benchmark才是AI能不能真正上手用的核心标准
    查看AI文稿
  • 看完就不会去花冤枉钱了。#老嗷嗷高 #大模型本地部署 #AI
    01:42
    查看AI文稿
  • 本地大模型,谁用谁知道#macbookpro #科技产品体验 #本地大模型 #ollama
    00:55
    查看AI文稿
  • 本地大模型,自定义工具使用方法 #大模型  #工作站  #算力  #大模型应用
    01:19
    查看AI文稿
  • Qwen3.6-27B,27B 干翻 397B 巨无霸 直接说结论:这是 27B 的 Dense 多模态模型,在 SWE-bench 编码测试上,把上一代 397B 的大哥干翻了。小了整整 15 倍,反手一巴掌。
 为啥说这个尺寸是甜点?FP8 量化版只要 27GB 显存,单卡 L40S 或者 A6000 Ada 就够跑,门槛直接砍一半。
 这次两个核心卖点:Agentic Coding,real-world 编码直接对标 Claude 4.5 Opus,Terminal-Bench 打平;Thinking Preservation,多轮对话保留历史思考上下文,代码迭代再也不用每轮重新想一遍。
 部署用 vLLM,加上 --reasoning-parser qwen3 就行。显存不够,直接把模型名换成 FP8 版,其他参数一毛一样,显存需求腰斩。
 权重在 HF 和 ModelScope 都有,商用随便用。阿里这波,是真卷出来了。
    00:57
    Qwen3.6-27B,27B 干翻 397B 巨无霸 直接说结论:这是 27B 的 Dense 多模态模型,在 SWE-bench 编码测试上,把上一代 397B 的大哥干翻了。小了整整 15 倍,反手一巴掌。
    为啥说这个尺寸是甜点?FP8 量化版只要 27GB 显存,单卡 L40S 或者 A6000 Ada 就够跑,门槛直接砍一半。
    这次两个核心卖点:Agentic Coding,real-world 编码直接对标 Claude 4.5 Opus,Terminal-Bench 打平;Thinking Preservation,多轮对话保留历史思考上下文,代码迭代再也不用每轮重新想一遍。
    部署用 vLLM,加上 --reasoning-parser qwen3 就行。显存不够,直接把模型名换成 FP8 版,其他参数一毛一样,显存需求腰斩。
    权重在 HF 和 ModelScope 都有,商用随便用。阿里这波,是真卷出来了。
    查看AI文稿
  • 2026全球AI模型最新排行,编程实力一目了然 从综合实力到编程能力实测对比,包含SWE-bench、ARC-AGI等真实数据。分享各模型适用场景与本地部署思路,附带AI工具箱体验指南,新手也能轻松上手!#AI模型 #ClaudeCode #AI工具 #AI提效 #AI教程
    01:45
    查看AI文稿
  • 本地大模型怎么自定义工具 #电脑配置  #工作站  #大模型  #算力
    01:02
    查看AI文稿
  • 养龙虾|本地模型的选择 #养龙虾 #openclaw #MacStudio #本地模型 #qwen
    08:36
    查看AI文稿
  • 调用本地模型效果怎么样? #本地大模型 
#本地大模型效果
    00:41
    查看AI文稿
  • Mac Studio 3 Ultra跑本地模型效果如何? 今天装机qwen3.6-35b,网红模型,效果满意,你们觉得怎么样?
#macstudio #本地模型 #openclaw #科技下一站 #长期主义好物清单
    01:55
    查看AI文稿
  • 本地模型优化,长对话不爆 Token-适合Hermes和龙虾 #HermesAgent
    07:03
    查看AI文稿
  • Gemma4 26B 本地能力测试
#gemma4 #hermes #hermes爱马仕
    01:10
    查看AI文稿