找回密码
 立即注册
搜索
查看: 190|回复: 3

[心得体会] 关于本地部署小模型的一些心得体会

[复制链接]
成绩
70
313
1165
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 948 根
狐火 : 1212 团

红美铃紫苑女苑

发表于 2026-9-8 11:38:22 | 显示全部楼层 |阅读模式
这几年的大语言模是型越来越牛逼了,但是联网的大模型通常自带一套模型层面的道德审查,破甲也没有想象中那么好做,而且往往很不稳定

最近在尝试使用大模型做三字的时候还遇到了若干过于昂贵的问题,这就促使我转向了本地部署
让我比较惊喜的是,今年的小模型相较于2023年已经好用了不止一个层次,qwen的4B参数量比那时候的32B还能打,而且huggingface也不用梯子了,ollama之类的配套设施也很完善了
总而言之就是部署很方便!


经测试,32gb内存,4060laptop显卡,加载qwen3.5 4B 破限版本,上下文开到64k的情况下,能跑到60tokens/s的输出速度,这个速度是绝对可用的,起码看着不难受
实际占用内存也非常小,随便多开的程度
模型的智商正在测试中,已经接入了dsh,准备用来量产口上,一天跑个两万行还是轻轻松松的;跑酒馆有时候会会错意,但是上下文一致性还不错,目测接入harness打零工应该可以节约不少token
比如主流程让大模型控制子代理交给小模型有问题再修之类的……应该会有不少用途


但是我已经贫穷到接不起大模型了,所以当务之急就是搓一个给小模型用的流程出来
今天下午就开工
成绩
70
313
1165
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 948 根
狐火 : 1212 团

红美铃紫苑女苑

 楼主| 发表于 2026-9-8 11:46:03 | 显示全部楼层
嘛虽说如此其实也是有朋友的token烧的……偷偷烧一点
或许我接不起大模型,但是也或许可以
沙发 2026-9-8 11:46:03 回复 收起回复
成绩
147
2035
4136
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 3406 根
狐火 : 3233 团

大妖精(金)红美铃玛丽女苑

发表于 2026-9-8 15:23:49 | 显示全部楼层
小模型感觉语料不够,不一会儿就开始重复,所以要经常主动修改,大模型又要疯狂思考,所有高质量内容都是思考出来的,导致破限只要影响到思维链就容易输出全变成垃圾,只能说卡在这里了
板凳 2026-9-8 15:23:49 回复 收起回复
成绩
1
69
2504
主题
帖子
积分

进度

四尾狐

资源
尾巴毛 : 2488 根
狐火 : 296 团

大妖精红美铃

发表于 2026-9-8 18:24:57 | 显示全部楼层
或许将来会出现一群人搭伙买工作站部署本地ai,比如凑几十个人,每个人出几万块
地板 2026-9-8 18:24:57 回复 收起回复
请思考你是否真的想要回复本帖,▶你真的想要谢谢楼主吗?;那就请回复有意义的内容
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|Kitsune Jinja |每日参拜

GMT+8, 2026-9-27 04:50 , Processed in 0.031858 second(s), 49 queries .

Powered by Discuz! X3.5

© 2001-2025 Discuz! Team.

快速回复 返回顶部 返回列表