Claude Code Hooks 详解:给你的智能体加一层确定性保障
什么是 Claude Code Hooks? Hooks 是用户自定义的 shell 命令(也支持 HTTP 端点、MCP 工具和模型提示词),Claude Code 会在生命周期的固定节点自动执行它们:调用工具之前、编辑完成之后、会话开始时、Claude 回复结束时¹。CLAUDE.md 给模型的…
Vibe Coding 资讯、案例、开源与工具聚合 · 每日更新
什么是 Claude Code Hooks? Hooks 是用户自定义的 shell 命令(也支持 HTTP 端点、MCP 工具和模型提示词),Claude Code 会在生命周期的固定节点自动执行它们:调用工具之前、编辑完成之后、会话开始时、Claude 回复结束时¹。CLAUDE.md 给模型的…
随便问一圈就会发现,大多数人把 agent 的指令文件当成一件戏服。“你是一位资深开发者。”“扮演一位大学历史教授。”人设提示词有它的用处,但在真正用一个 AGENTS.md 生活了几个月之后——改文档、写代码、给真实的翻车善后——我的结论是:人设是这个文件里最没意思的部分。真正有价值的是另一种内容…
通用智能体能处理各种任务,但你还需要它们遵循业务运转的既定流程:合规检查、文档处理工作流、升级策略、工程规范。把这些全塞进一个系统提示或应用逻辑里,维护和更新都会变得很困难。 技能(Skill)是一种模块化的替代方案。一个技能就是一组可复用的指令,通常存放在 SKILL.md 文件里,用来教智能体完…
Vercel Sandbox 的 Drive 功能现已进入公测阶段,Hobby、Pro 和 Enterprise 套餐均可使用。Drive 是一种持久化存储,可以挂载为 Sandbox 里的一个目录。它不依附于某一个 Sandbox,因此同一块 Drive 能跨多次运行、跨不同 Sandbox 实例…
评估 AI 智能体的重点,不是它某句话说得对不对,而是它能否在真实环境中把几十次工具调用串成完整工作链,并在出错后自行恢复。这意味着评估粒度要从「单次函数调用」升级到「整个任务」。 一个被问错的问题 上线一个 AI 智能体(AI agent,指能够自己调用外部工具、分多步把任务做完的模型程序)之后…
最糟糕的莫过于:某个改动在预发布环境(staging)测试通过,到了生产环境却表现不一样。所以我们希望给你一个尽可能接近生产的环境——让你充分检验改动,确保它们的行为完全符合预期。智能体帮我们提交了前所未有的代码量,而改动越大,发布前需要覆盖的测试范围就越广。理想情况下,这些测试不应该拖慢智能体的速…
今年早些时候,我在陪产假期间挤出的一点空闲时间。带女儿去图书馆、在花园里铲土、把无数玩具放回箱子之余,我做了一个小网页游戏。你可以在 thisdungeoneternal.com 玩到它。 氛围编程行不通 我尝试只通过 opencode 使用 GitHub Copilot,尽量少自己读代码和改代码…
定义 schema opencomputer/ └── database/ └── migrations/ ├── 001_initial.sql └── 002_monitor_runs.sql sql CREATE TABLE monitors ( i…
Opening|12 分钟阅读 最近我在搭一套工作流:让编码智能体(coding agent)把一项任务从头走完——分诊、规划、实现、验证,最后开一个 PR。随着工作流和模型越来越好,让我意外的反而是:实现已经不再是我最担心的环节了。 智能体改代码快得惊人。真正难的是让它验证这些改动,并判断什么样的…
Benchling 需要在上千个生命科学租户中运行 AI 代理生成的科学代码,其安全团队发现,传统的沙箱机制远远不够。如今,这套架构每天处理超过 600 次代码执行会话,每周覆盖 250 多个租户,实现了零安全事件。 标准网络管控会拦截 HTTP、限制出口端口、约束对外连接。但 DNS 解析往往仍然…
几天前,我在公司合并了一个改动:把整个 monorepo 的 ESLint 换成了 oxlint。顺便说一句,oxlint 真的很棒。规则集完全对齐之后,一次全量本地 lint 从 3 分钟缩到 1 秒左右。那天心情相当不错。我终于可以告诉大家:以后 push 不用再加 --no-verify 了。…
一个会话负责协调与核验,其他会话负责执行,再由一块持久化的看板保存状态。这套「编排者—执行者」循环,专为长时间运行的 Claude Code 智能体设计。 长时间跨度的 AI 编程任务之所以失败,往往不是因为智能体不会写代码,而是因为它们的上下文转瞬即逝,自我汇报又不可靠。解决办法属于组织层面,而非…
今天我们发布 Kimi K2.5,这是迄今为止最强的开源模型。 Kimi K2.5 在 Kimi K2 的基础上继续预训练,使用了约 15 万亿个视觉与文本混合 token。作为原生多模态模型,K2.5 在编码和视觉能力上都达到了业界领先水平,并引入了自主智能体集群(agent swarm)范式。…
我现在还是经常用 Opus 4.6 和 4.8。Opus 5 往往太啰嗦,Fable 又太贵。下面说说怎么把它们加回 /model 选择器。 把这段配置加到 /.claude/settings.json。这些选项会排在内置选项后面: "modelPicker": { "options": […
构建多模型智能体(Agentic AI)应用的企业,正面临越来越复杂的基础设施问题。要为多种模型管理容器编排、扩缩容策略、身份认证和可观测性,运维负担相当重。团队常常把大量时间花在基础设施上,而不是智能体的逻辑开发。如果开发者把智能体框架跑在自管理的基础设施上,比如配合 AWS Fargate 使用…
v0 现在支持安装来自 npm 和自定义仓库的私有包,凭据存放在 Vercel 的共享环境变量里。团队可以直接在 v0 中基于现有的设计系统、组件库和内部包来开发,省去不少配置麻烦。 要开始使用,在 Vercel 上添加下面任意一个共享环境变量,作用范围选 Development 和/或 Previ…
把一个 Hugging Face 模型部署到生产环境,意味着一连串决策:为模型的架构挑选合适的服务容器、确认当前 AWS 区域可用的镜像 tag、再根据模型的显存占用匹配实例类型。基础设施之外,你还得接上自动扩缩容,免得闲着的端点白白烧掉 GPU 时长;还要配好 Amazon CloudWatch…
项目简介 WeKnora 是腾讯开源的一站式 LLM 知识平台,目标是把原始文档直接转化为「可查询的 RAG 知识库 + 自主推理 Agent + 自维护 Wiki」三位一体的知识底座。它覆盖从文档解析、Embedding、向量检索、Reranking 到 LLM 生成问答的完整链路,同时内建 Ag…
热门观点(hot take)把复杂话题浓缩成一句自信满满的断言。这样容易引发互动,却未必有助于理解。 这类观点在表面上其实无关紧要——你同意、反对、转发,争论几分钟,然后翻篇。它有时大方向是对的,有时纯属胡说。热门观点的价值,在于你不再跟着情绪走、开始动手拆解它的时候:它在什么条件下成立?缺了哪些背…
开源评测框架 Harbor 现在可以在 Vercel Sandbox 上跑基准测试,每个测试任务运行在独立的 Firecracker 微型虚拟机中,并发规模不再受本地机器限制。搭配 AI Gateway,同一套基准换模型重跑只需修改 --model 参数。该功能要求 Harbor 0.22.0 及以…
Claude Code 的 Projects 功能迎来全面重构,从"提示词文件夹"升级为多 Agent 并行协作中心:用户下达目标后,云端派生多条 Git 分支同时开工,写完自动提 PR。Anthropic 同时公开内部数据——研发平台每天运行约 3 万个 AI Agent,核心 AI 研发工作已有…
skills CLI 1.7.0 把 Notion 加入技能安装来源。团队可以在 Notion 工作区里编写、评审和更新智能体技能,再装到支持该 CLI 的智能体上。权限直接沿用 Notion 页面权限,既不用另建授权系统,也不用专门维护一个 Git 仓库。 这次更新做了什么 skills CLI…
在 Amazon Quick 上,每次调用 Model Context Protocol(MCP)工具都是一次访问事件,除了有效的令牌之外,还可能需要针对工具和参数做纵深防御授权。如果缺少细粒度控制,一处权限配置出错,就可能绕过企业为满足合规要求而设的访问限制。本文将带你实现一套多重关卡授权模式,按…
现在,你和你的 AI 编程助手都能通过 Vercel CLI,在不到一秒内把静态产物部署到 Vercel。运行 vercel deploy,即可分享原型、发布 HTML 报告,或预览编程助手生成的页面。 Vercel 会自动识别符合条件的部署,产物校验通过后跳过构建步骤,直接返回一个可访问的线上地址…
摘要:Claude Code、Cursor 这类编程智能体能接过一个 issue,返回改好的代码、测试和 pull request;而多数 SaaS 产品里的 AI 只能回答问题或生成文本。差距的关键不只是底层模型,更在于编程智能体拥有一个可以动手、检查、重试的真实环境。本文拆解这套环境的五个特点,…
Claude Code 改版后的 Projects 功能,让用户能在同一个项目里运行多个智能体(AI agent),共享记忆、目标,以及文件和产物库。Grok Bot 等工具也能管理一组 AI 智能体,Projects 的做法类似:每个项目下都有多个“线程”,并行处理不同任务,再由一个“协调器”统一…
作者用几个月时间,借助 AI 把一个线上跑了六年的个人小工具彻底重写并扩写。他从中得出一个核心判断:AI 编程的关键不只是模型有多强,而是能不能给 AI 搭起一个完整的「反馈闭环」。本文记录了重写的过程、踩到的局限,以及由此延伸出的思考。 前言:AI 编程的关键是「反馈闭环」 最近我用 AI 改写…
Anthropic 放出了一段访谈,主角是 Claude Code 团队,话题是他们如何用 Claude Code 持续优化 Claude Code。核心方法可以浓缩成两句话:给 AI 下目标、而不是逐条检查它的每个动作;对自己造出来的东西保持「不执着」,因为模型能力每两个月就会变一次天。 一年之…
GitHub Copilot CLI、GitHub Copilot 应用和 GitHub Copilot SDK 背后都是 Copilot agent runtime(智能体运行时),这是一个可以嵌入各类应用和服务的智能体运行框架。它最初用 TypeScript 编写,运行在 Node.js 和 V…
为什么必须让 linter 和工具先就位,再交给不确定性极强的 AI 智能体(agent)去干那些苦力活。 概述 语言模型(LLM)的本质是逐个采样 token。同一个提示词跑两遍,可能产出两份不同的文档,而且差别往往不只是措辞。差异会体现在结构上:跳了一级标题、代码块没写语言、该用直引号的地方出…