JEV 模型是什么:一个「不说话」、只输出带概率决策的 AI
JEV 是由 RLHF 共同发明人 Diogo Almeida 创立的 TypeSafe AI 推出的「决策模型」,它不生成文本,只把非结构化输入映射为带概率的类型化判断。本文拆解它的三种输出原语、RLCD 训练方法、性能价格,以及它和大模型到底是什么关系。
2473 字
|
12 分钟
如何科学评测一个 LLM 应用:基准、A/B 与人工评估
把「感觉这次好多了」换成可复现的数字:从公共基准的局限、自建评测集与 LLM-as-a-Judge 的偏差,到配对显著性检验与线上 A/B,附一个带位置交换和置信区间的 TypeScript 判官。
2989 字
|
15 分钟
可观测性三支柱:Metrics、Logs 与 Traces 不是三种数据,而是同一条事件流的三种粒度
Metrics、Logs、Traces 都齐了,事故还是定位不了——因为问题不在「有没有三个系统」,而在三者能不能互相对上。本文讲清每条支柱各自的失效方式(高基数、采样丢尾、日志不可聚合),并给出把 metric 毛刺跳到具体 trace 的三种接法:统一 resource attributes、exemplar、日志注入 trace_id。
2847 字
|
14 分钟
边缘计算在 Web 中的应用:把代码搬到离用户更近的地方
把「边缘计算」拆成三个可验证的工程问题:一次请求的物理账怎么算、V8 isolate 究竟省掉了什么、以及面对 128MB 与 10ms 这两条硬限制,哪些逻辑该搬到边缘、哪些必须留在源站。附本站 Cloudflare Worker 的真实 CORS 与限流代码。
2629 字
|
13 分钟
程序员转行图鉴:从写代码到卖烤串
深夜群里一句「不行就回老家卖烤串」,能收到一整排「带我一个」。把这份转行图鉴摊开来看,每个选项背后藏着的,到底是对另一种生活的向往,还是对当下处境的逃跑。
916 字
|
5 分钟
如何向爸妈解释你的工作:为什么你妈至今以为你在修电脑
「在哪儿上班?」「修电脑的吧?」「帮我看下手机」——向爸妈解释程序员的工作,难的不是技术名词,而是你交付的东西在他们眼里根本看不见。用「敲桌子实验」和一条翻译函数,聊聊怎么把不可见的工作说成人话。
1946 字
|
10 分钟
程序员与咖啡因:续命水的一百种喝法
「程序员是一台把咖啡转换成代码的机器」——这句玩笑背后有一串可查的数字:400 毫克、半衰期 5 到 6 小时、一茶匙粉末约等于 28 杯。把续命水的剂量和原理一起讲清楚。
1884 字
|
9 分钟
技术债的识别与管理:别再用「代码烂」当借口
技术债的原意是「借款 + 利息」,不是「代码烂」。本文用 Cunningham 的原话和 Fowler 的四象限理清概念,给出一份可直接运行的 git 热点分析脚本,用它在本站真实仓库里找出「改动最频繁 × 最绕」的文件,再谈怎么给债务定价、以及什么时候该还、什么时候该认。
3883 字
|
19 分钟