国产开源大模型推理成本再降,中小企业本地部署越来越现实
最近帮一个做客服系统的朋友算了笔账,同样是跑一个七十亿参数级别的模型,年初用云上商业 API 每月要小一万,现在换成国产开源模型加一块二手的 4090 本地跑,电费加硬件折旧一个月一千出头,回答质量对他们的场景来说差距很小。
这波成本下来主要靠三件事:量化技术成熟了,4bit 量化后精度损失控制得很好;国产模型开源 ...
Objection撬安卓App:五条最常用的动态调试命令手记
做安卓逆向,静态看代码只能解决一半问题,另一半得动态跑。Objection是我用得最多的工具之一,Frida环境装好后一条 objection explore 就能挂上目标进程,不用自己写hook脚本。
日常最高频的几条:android hooking list activities 看所有页面入口;android hooking watch class 配合 watch class_method 能盯到目标方法 ...
向量数据库入门:FAISS和Milvus的选型对比与踩坑
给公司知识库项目选向量数据库,纠结了FAISS和Milvus一个星期,最后两个都搭了一遍,说点实际感受。
FAISS是库不是服务,单机几十万到千万级向量,检索速度毫秒级,代码十几行就能跑通,适合数据量固定、不需要频繁增删的场景。坑在持久化要自己管,重启加载索引的时间不短,增量更新更是要自己重建。Milvus是完整的服务, ...
GGUF量化模型实测:Q4_K_M和Q5_K_M的差距比想的小
手头一张24G的卡,想在本地跑Qwen3-32B,原版精度肯定放不下,就认真测了一下GGUF各个量化档位。Q4_K_M大概19G,Q5_K_M是22G多,都能塞进去。
拿一套50道题的测试集跑分,Q4_K_M对了41道,Q5_K_M对了43道,差距在一个点上下,但Q4的速度快了差不多四成。肉眼对比两个版本的回答,大多数场景真的分不出来,只有长推理链的任 ...
大模型结构化输出实战:让Qwen稳定吐JSON的三种办法
前阵子做一个信息抽取的活,要大模型从简历文本里吐JSON,Qwen2.5-14B直接让它输出JSON,十次里总有两三次格式崩掉,多一个逗号或者少个引号,下游解析就炸。
试了三种办法。最简单的是在prompt里给一个schema加few-shot例子,能解决大半问题;更稳的是vLLM的guided_json,解码的时候直接按schema约束词表,输出百分百合法 ...
Whisper本地语音转文字部署手记:显卡精度和速度的取舍
最近要把一堆会议录音转成文字稿,云服务按小时收费算下来不便宜,就试了本地部署Whisper。1080Ti跑large-v3模型,fp16精度下一小时音频大概四分钟转完,显存刚好卡在10G出头。
实际用下来对中文的准确率比想象中好,专业名词错的少,标点也会自动加。换faster-whisper这个包用CTranslate2后端之后,同模型速度翻了一倍多 ...
建筑垃圾资源化:再生骨料铺进市政道路这门生意划算吗
上个月去参观了一个建筑垃圾资源化项目,进了厂才知道拆迁产生的混凝土块能破碎筛分成再生骨料,按级配卖出去做道路垫层和再生砖,一吨能卖三四十块。
之前这类项目不赚钱,主要卡在原料上:收垃圾要给拆迁方交钱,出来的人工分拣成本又高。现在不少城市强制要求拆迁现场分类堆放,源头分好了,进厂成本低了一大截,账才算 ...
运营商用AI拦诈骗电话:一天几十万通拦截背后的大模型
有个同学在运营商做反诈系统,聊了一次才知道现在拦截诈骗电话主要靠AI了。传统的黑名单只能拦已知号码,诈骗团伙换号比换衣服还勤,根本拉不完。
现在用的是大模型加声纹和通话行为分析,一通电话进来,通话节奏、关键词、主叫行为的几十个特征实时过一遍,可疑的直接预警或者断线。他说系统一天要过几十亿次呼叫,拦下的 ...
虚拟电厂是什么:把写字楼的空调和充电桩聚起来当电厂用
最近跑了个虚拟电厂的项目现场,算是把概念看明白了。简单说就是把写字楼空调、充电桩、储能这些分散的资源聚合起来,用电高峰的时候统一调低功率,省出来的负荷相当于一座虚拟的电厂。
深圳那边一个聚合商管着两百多栋楼,响应一次需求能削掉几万千瓦负荷,参与的企业按响应量拿补贴。物业经理说夏天下午空调调高一两度, ...
欧盟碳关税CBAM落地:出口工厂都在恶补碳账这本明细
表哥在东莞开五金厂,做欧盟订单十几年了,今年被CBAM搞得焦头烂额。过渡期报告要求披露产品的碳排放数据,客户直接甩过来一张表格,连生产用了多少度电、烧了多少天然气都要填。
麻烦的地方在于国内不少工厂根本没有碳核算的基础,电从哪个电厂来的、电网排放因子用哪个值,都没人算得清。现在催生了一批做碳核算的服务商 ...