【LLM推理避坑手册:把昂贵的算力变成真正的生产力】| blog

Modular发布了一份开源的LLM推理手册,系统梳理了从GPU架构到持续批处理、前缀缓存等核心优化技术。

它不只是静态文档,还内置了KV Cache内存计算器、Token流转可视化及量化影响模拟器等交互工具,旨在解决推理侧知识碎片化且门槛高的问题,帮助工程师在生产环境中实现模型的高效落地。

当大模型进入应用深水区,比拼的不再是模型规模,而是每单位算力的产出比。开发者在追求模型性能时,往往容易忽略推理侧的工程细节,比如Prefill-Decode分离或分块预填充对服务等级协议的影响。

这本手册的价值在于把黑盒化的推理过程透明化,它提醒我们:在算力受限的背景下,理解Transformer底层的数据流向和内存占用,比单纯堆硬件更能决定业务的生死。
【软件开发的重心正在从编写代码转向上下文工程】| 帖子

这套个人软件工厂方案展示了如何通过多智能体协作实现全自动开发:它将任务拆解为访谈、规划、测试、执行与审计九个环节,用昂贵模型做决策,用低 Token 成本模型如 Grok 执行,并自动生成录屏和语音讲解向人类汇报。

其底层逻辑在于,当 AI 产出代码的速度远超人类阅读速度时,开发者的瓶颈不再是写不出代码,而是无法理解和掌控庞杂的系统。

这套架构通过预设测试用例和自动更新说明书,解决了人类与 AI 之间的信任与理解偏差。它提醒我们,未来开发者的核心竞争力不是写 Prompt,而是设计一套能自我纠错、并能让人类始终保持决策权的协作流水线。
【你读的科研论文,可能只是被LLM挤压出来的"学术口水"】| blog

unslop.run对12,750篇arXiv论文进行了采样分析,发现在2026年初,近39%的新提交论文带有明显的机器编写痕迹,计算机科学领域这一比例甚至高达65%。为了排除干扰,研究者将ChatGPT问世前的论文误报率压低至0.4%作为基准,这意味着目前观察到的激增并非算法幻觉,而是学术产出的真实异变。

这场"学术大爆发"背后隐藏着更深层的悖论:学术界长期推崇的、严谨到近乎僵化的写作风格,恰恰成了LLM最容易模仿的模版。对非母语学者而言,AI是弥合语言壁垒的生存工具,但对科学共同体来说,这正在演变成一种"认知萎缩"。

当论文从思考的结晶变为被提示词挤压出的标准件,文字背后的怀疑精神和论证意图就被稀释了。如果投稿和审稿都变成机器之间的互搏,学术出版可能不再是知识的累积,而是一场低成本、高损耗的信号干扰。
【AI编程代理的“系统性风险”:OpenCode被指架构设计存在低级失误】| blog

本文深度解剖了坐拥16万星的开源AI代理OpenCode,指出其多项“致命伤”:Prompt Cache机制设计业余,甚至会因日期更迭导致缓存全量失效而浪费大量Token;基于字符串正则的权限过滤极其脆弱,通过简单的base64编码或环境变量赋值即可绕过所谓的命令禁令。

尽管社区对OpenCode的生产力提升褒贬不一,但这揭示了当前AI工具链的一个残酷真相:许多明星工具在追逐“灵动感”时,完全抛弃了基本的系统安全常识。对于开发者来说,盲目给AI代理授权等同于在本地运行一个不受控的高权限Shell。

这件事的核心价值不在于是否弃用某个工具,而在于提醒我们:AI的工程化不能只靠Vibe注入,比起迷信GitHub星数,你更需要关注工具处理Context和沙箱的底层逻辑,而不是指望靠正则匹配来保命。
所有生产工具的终局都一样:刚开始你以为它帮你跑得更快,后来发现它只是让你同时往更多方向跑。拖拉机不会让你只种一块地,只会让你承包更多荒地然后依然种不完。AI也是,它降低的是启动成本,但完成一个项目需要的那些脏活累活——决策、取舍、收尾——一个都没少。
Three.js Object Sculptor 是一个 Codex 插件,能把附件中的物体图片直接转换成纯代码、可动画的 Three.js 程序化模型。

它不做照片建模,也不下载外部资源,而是引导 Codex 按照雕塑流程逐步完成:验证图片、拆解结构、生成几何与材质系统、搭建动画友好层级,最后用浏览器渲染结果与原图比对验收。

主要功能:

- 将物体图片重建为纯 TypeScript 代码的 Three.js 模型;
- 支持复杂层级、关节枢轴、父子关系与动画锚点,便于后续动画、物理或破坏;
- 提供自适应构建流程,从块状到细节逐层打磨,并记录质量合约;
- 内置多角度截图对比与 AI 视觉审查,确保关键特征不丢失;
- 可提取参考图片的程序化 PBR 材质证据,生成 albedo、roughness、normal 等贴图信息;
- 提供统一命令行入口 scripts/sculpt.py,同时兼容旧版脚本;
- 最终输出为可复用的对象工厂,适用于游戏道具、Web 交互演示和可视化原型。

支持本地 Codex 插件安装,需 Python 3.10+ 与 Three.js 浏览器项目,适合希望用代码重建参考物体的开发者与创作者使用。
Marketing Skills 是专为 AI 代理打造的市场营销技能合集,面向技术营销人员与创始人,涵盖转化优化、文案撰写、SEO、数据分析与增长工程等全流程能力。

包含 40 余个独立技能模块,通过 product-marketing 统一产品定位与受众洞察,支持 Claude Code、Cursor、Windsurf 等主流代理。通过 npx skills 命令一键安装或作为 Git 子模块持续更新。

主要功能:
- 覆盖 CRO、copywriting、SEO、ads、analytics、referrals、revops 等 40+ 营销场景;
- 技能间相互引用,执行任务时自动调用最优上下文;
- 支持 CLI、Claude Code 插件、SkillKit 多代理安装,兼容本地与云端部署;
- 提供技能升级与产品营销上下文迁移指南,保障版本平滑过渡;
- 内置营销心理模型、竞争分析、定价策略与产品上线流程,满足全链路需求。

适用于快速生成落地页文案、搭建 A/B 测试、规划增长实验,支持 AI 代理精准调用专业流程。
video-shotcraft 是一套专为 AI 代理打造的电影级产品视频制作工具,它把 106 张镜头配方卡、161 段动态预览和一套完整可运行的模板全部整合在一起,让 Claude Code 或 Codex 直接变成专业的动效工作室。

只需把产品截图、品牌文案交给代理,它就能自动完成分镜、2.5D 运镜、节奏剪辑和音效设计,快速生成高质量的宣传片、演示视频或发布片。仓库内置的 Ink Press 模板已验证可直接复用,36 秒内即可得到 1920×1080、30fps 的成片效果。

项目同时提供完整的生产流程、视觉质检标准和声音设计指南,适合任何需要快速产出电影级产品视频的团队或个人。

主要功能:

- 106 张镜头配方卡,包含目的、时长、参数和实现要点;
- 161 段运动预览,支持在线画廊搜索、筛选和直接复制;
- 完整 Remotion 实现,内置真实页面捕捉、2.5D 运镜和节奏同步;
- 验证过的 Ink Press 模板,36.2 秒成片,可直接替换产品素材;
- 完整的生产方法论,涵盖拍摄、故事板、声音设计和最终质检;
- 支持网页和桌面产品宣传片,也可用于功能演示和品牌影片。

支持通过 npx skills add 或直接克隆仓库安装,立即在 Claude Code / Codex 中使用。
【抛弃 Docker Desktop:苹果原生容器平台的 SwiftUI 拼图】

Davit
是一款专门为 Apple 原生容器框架设计的开源管理工具。它摒弃了 Electron 和 Docker 引擎,完全采用 SwiftUI 开发,体积仅 17MB。通过直接与苹果系统的 ‘container-apiserver’ 进行 XPC 通信,Davit 提供了从镜像构建、Compose 导入到容器文件浏览的全套功能。

多数用户习惯了 Docker Desktop 的沉重,却忽略了苹果在 Apple Silicon 时代已在底层提供了高效的 Linux 容器运行环境。Davit 的核心逻辑不是运行一个笨重的后台守护进程,而是让容器直接以微型虚拟机的方式在苹果虚拟化框架上跑。

虽然目前仅限 Apple Silicon 且对系统版本有要求,但它代表了一种更原生的开发路径:更低的资源损耗和更快的冷启动速度。这不仅是工具的选择,更是对原生容器架构的一次补完。
【如果你想靠自学拿下一个数学学位:一份清醒的通关指南】| blog

Susan Rigetti 整理了一份从零到数学系本科水平的自学路线图。

这份指南跳过了“我是不是数学这块料”的无谓纠结,直接将进阶拆解为从 Calculus、线性代数到实分析、微分方程的九个核心阶段,并为每个环节匹配了经典教材。它强调了一个被很多圈外人忽视的事实:数学在进阶阶段不是关于计算,而是关于证明,而做题是通往理解的唯一路径。

国内自学者往往不缺资料,缺的是对学习难度的预期管理和体系化的全局视角。Rigetti 戳破了一个流传甚广的谎言:你并不需要拥有所谓的“数学大脑”才能理解宇宙的语法,只要能理解语言的语法结构,就能在耐心中掌握数学。有人质疑这种“理想化路径”不如好奇心驱动有效,但对于缺乏学术资源的人来说,一套被前人验证过的知识骨架,是性价比最高的通关文档。它带给读者的不只是书单,还有一种将数学视为通用语言的底层尊重。
Bento:把全功能幻灯片工具塞进一个HTML文件】

这款名为Bento的开源项目实现了将编辑器、演示文稿和协作功能全部封装在单个约560KB的HTML文件中。

开发者利用base64压缩和浏览器原生解压API,让它无需安装或联网即可运行。最硬核的是它通过加密盲中继实现的实时协作,数据在传输中保持加密,服务器无法感知内容。

项目大量代码由Claude辅助完成,旨在解决AI生成的演示文稿往往属于一次性消耗品且难以由非技术人员二次编辑的问题。

这件事的重要性在于单文件Web应用(Single File Web Apps)的理念回归,它是对目前软件即服务租用模式的一种技术反叛。虽然目前在Firefox性能表现和隐私配置透明度上仍有优化空间,但它展示了在AI协作时代,个人开发者能以极低成本构建出具备复杂交互和本地优先属性的专业级工具。

这不仅是工具的演进,更是数据所有权从云端向个人终端的一次权力回归。
Pireel Studio 是一款完全开源、无需后端的 AI 视频编辑器,专为口播视频打造。它把故事板、图形设计、动态字幕、主题系统与浏览器内 WebCodecs 导出全部集成到一起,编辑全程在本地完成,无需账号、无需服务器。

只需在浏览器里拖入一段视频,画布即可跟随画面实时联动;故事板、动态字幕、主题切换、时间线、实时预览和导出全部在客户端运行。草稿保存在 localStorage,视频文件存于 OPFS,零数据出境。

通过 MCP 即可让任意 AI Agent(Codex / Claude Code)直接驱动编辑器;也可以在本地用 pnpm 一键启动,适合个人创作者、短视频团队或二次开发集成。

主要功能:
- 全浏览器编辑:口播轨道、区块、字幕、时间线、实时预览;
- WebCodecs 导出:所见即所得,导出无需服务端;
- 主题系统:数十套设计系统即换即用,涵盖调色、字体与布局;
- 本地存储:所有素材与项目均保存在浏览器内;
- MCP 驱动:支持外部 AI Agent 通过插件直接操作;
- 模块化架构:可按需注入转录、合成、云存储等 Provider。

支持 Chromium 浏览器,通过 pnpm install && pnpm dev 即可本地运行,AGPL-3.0 协议开源。
Reviva 是一款本地优先的 AI 学习工作台,围绕用户自己的资料完成问答、笔记、复习与创作输出。它把 Wiki 知识库、AI Agent、技能系统和创作工具整合到同一个桌面应用中,让学习过程不再从空白聊天框开始。

Reviva 支持多 Agent 协作,可在对话中随时切换角色并共享上下文;资料可以被解析、检索并持续沉淀为 Wiki;从同一份材料出发即可生成测验、闪卡、思维导图、PPT、播客或研究报告,所有结果都能回流到笔记与知识库,形成完整的学习闭环。应用支持本地模型与自有 API Key,数据全程可控,适合学生、研究者和知识工作者长期使用。

主要功能:
- 多 Agent 工作台,可自定义角色、模型与权限;
- 围绕本地文档、文件夹或 Wiki 进行检索与对话;
- 音视频解析、语音转录与关键帧提取;
- 一键生成测验、闪卡、导图、图表、PPT、播客与研究报告;
- 文档与笔记管理,支持 Office、PDF、Markdown 等格式;
- Wiki 知识库自动维护与来源追溯;
- 本地优先,支持完整备份与回收站;
- 支持自定义工具与 MCP 服务。

支持 Windows 与 macOS,通过安装包即可快速上手,适合需要把 AI 真正嵌入学习与知识管理流程的用户。
Back to Top