Insights
从 Vibe Coding、AX 到 AI 代理,以及自制工具与实战案例。发布文章的完整正本,按主题归类。
想通过 YouTube 学 AI,该看哪些频道?
我梳理了 132 个订阅,只留下十一个真正用来学 AI 的频道。筛选标准只有一条:它展示的是构建过程的画面,还是结果的总结?分为四个展示全过程的、两个深耕单一工具的、两个落到组织与业务的、两个把握动向的、一个打基础的,并附上网址。

氛围编程缺的不是代码,是 UI/UX 概念
AI 会把需求变成界面,但不会替你决定什么该收起、什么该留下。同一张地图界面在六天内重新整理时实际用到的四条原则——照搬熟悉的东西、不要罗列而要归组、不要全部摊开而是按需展开、全部条目共有的事实交给标题。

如何读取 KakaoTalk 本地数据库,以及为什么只能在 Mac 上做到
KakaoTalk 没有提供让其他程序读取聊天内容的官方 API。想用代码处理这些消息,唯一的入口是 Mac 版 KakaoTalk 存放在自己应用容器里的数据库文件。该文件由 SQLCipher 整体加密,密钥由这台 Mac 的硬件 UUID 与 Kakao 账号内部编号共同派生。读取硬件标识的方式、应用存放文件的位置、以及保护该文件夹的权限体系全都属于 macOS,因此这条流水线只能在 Mac 上运行。它也无法在 cron 下工作,会静默挂起而不是报错。越过第一步之后,其余都是常规工作:按聊天室只取新消息、逐室生成摘要、推送到 Slack,再由 Slack 中的机器人撰写工单正文并登记到 Jira。

Bing Webmaster Tools — 从 GSC 导入站点并查看 AI 引用
Bing Webmaster Tools 是微软免费提供给站长的控制台,可以看作 Google Search Console(GSC) 的必应版:查看收录状态、搜索查询、站点地图和外链,并可直接提交 URL。如果已经在用 GSC,注册只需一步——在添加站点的界面选择左侧的 Import 并连接 Google 账号,GSC 中已完成所有权验证的站点会连同站点地图一起导入,无需再改 meta 标签或 DNS 记录。此外,自 2026 年 2 月起新增了 AI Performance 报告,免费显示 Microsoft Copilot 与必应 AI 摘要引用你页面的次数。

RSI、MACD 与布林带 — 量化智能体直接调用的五个技术指标
技术指标是从开、高、低、收、量这一份原始数据再计算一层得到的二阶数值。指标有数百种,但 AI 交易智能体通过单个工具直接调用的恰好是五个:RSI(14)、MACD(12/26/9)、布林带(20, 2σ)、SMA(20/50/200) 和 EMA(20),它们分别覆盖超买超卖、趋势反转、波动率与长期趋势。问题在于同一个名字并不代表同一个数字。RSI 取决于平滑方式是 Wilder 法(ewm alpha=1/14) 还是简单移动平均(rolling 14);布林带取决于标准差用 ddof=1 还是 ddof=0。接入指标之前该确认的不是阈值,而是计算公式。

Creem — 当 Toss 和 Stripe 都走不通时的收款方案
Creem 是一个由平台代替卖家承担销售主体身份的 Merchant of Record(MoR)收款平台。顾客在法律上不是向你购买,而是向 Creem 购买,作为交换,Creem 承担 190 多个税务辖区的税额计算、代收与申报,以及退款与拒付处理。费率为每笔成功交易 3.9% + 0.40 美元,没有月费也没有开通费。创建商品后拿到 product ID,把它填进代码就能打开收银台;付款完成后,你上传的文件会自动发送给买家。完全不写代码,只分享支付链接也能开始销售。

PillDoc 药局选址 — 如何在地图上读懂首尔的诊所与药局位置
药局选址是 PillDoc 公开的只读地图页面。它为首尔适合新开诊所和新开药局的位置打出百分制分数并标在地图上。在 https://www.pilldoc.co.kr/PharmSite 无需登录即可打开,点选某个位置还会显示预估处方流入、月调剂营业额和周边竞争药局。但页面上的所有金额与件数都是模型估算值,并非实际业绩。

4xx 与 5xx — 报错时该看哪里
错误码的第一位数字就决定了责任归属。以 2 开头表示成功,以 4 开头表示发出请求的一方(前端或输入值)有问题,以 5 开头表示接收请求的服务器有问题。查看状态码的方法是在浏览器中按 F12(Mac 为 Command+Option+I)打开开发者工具,在 Network 标签中点击失败的请求。用第一位数字定好方向之后,再顺着请求经过的区段(前端 → API → 后端 → 数据库)逐段排查,看是在哪个边界断掉的,因为故障大多发生在区段之间而不是区段内部。掌握这两步,就不必再和 AI 玩猜谜式的“帮我修一下”,而可以直接问“这个错误出在哪个区段”,从那一刻起修改才不再是猜测。

OfficeCLI — 终结 Excel、Word、PowerPoint 加班的命令行工具
OfficeCLI 是一个开源命令行工具,让 AI 代理和开发者用一行命令或一句自然语言就能创建、读取、修改 Word、Excel、PowerPoint 文件。它以单一可执行文件运行,无需安装 Microsoft Office,与其他自动化方式最大的不同是:它会把刚生成的文档渲染出来"看一眼",再自行修正。

KRX Open API —— 亲手测量 KOSPI 日涨跌幅
KRX Open API 是韩国交易所在 openapi.krx.co.kr 提供的公开数据服务。把密钥放入 AUTH_KEY 请求头,用 basDd 传入一个基准日期,即可以 json 取回当日的开高低收。申请就是官网标注的四步:注册并申请认证密钥、在服务目录中检索所需 API、提交使用申请、获批后接入。多数人会在此卡住一次,因为密钥批准与各服务的使用申请批准彼此独立,只拿到密钥就调用会全部返回 401。有了密钥,仅用标准库的 30 行 Python 就能算出任意区间的平均值、中位数与极端日天数。以单一个股杠杆 ETF 上市的 2026 年 5 月 27 日为界运行,前后各 48 个交易日的日涨跌幅绝对值平均由 2.56% 升至 4.08%,盘中高低幅平均由 2.99% 升至 5.81%。但数字变大与因何变大是两个问题,后者无法由这份数据判定。

ralplan 的三个智能体 — Planner、Architect、Critic
ralplan 是开源框架 oh-my-claudecode(OMC)中的共识规划工作流。在终端输入 /oh-my-claudecode:ralplan "任务描述",先上场的不是代码,而是三个智能体。Planner 被强制按格式写方案:3 到 5 条原则、3 个决策要素、至少两个可行选项。Architect 在 Write 与 Edit 工具被完全禁用的状态下审查,只能给出最强反驳。Critic 不给已写内容打分,而是找出缺失之处,最后判定为通过、返工或驳回。三者必须按此顺序执行,一旦被驳回,就由 Planner 修改后从 Architect 重新开始,最多五轮。在此期间方案始终标记为 pending approval,文件编辑、提交、PR 与执行移交全部被阻断。安装只需一行:/plugin install oh-my-claudecode 或 npm i -g oh-my-claude-sisyphus@latest,然后执行 /oh-my-claudecode:omc-setup。

OpenClaw 与 Hermes 对比 —— 该装哪一个
OpenClaw 和 Hermes 都是开源 AI 助手:你在 Telegram 或 Slack 里下达指令,它们就在你自己的电脑上创建文件、编写代码。两者能做的事几乎相同,真正拉开差距的是五点——自我学习、安全、记忆、技能生态和可持续性。其中自我学习与安全是 Hermes 领先,记忆与技能生态则不分高下。独自工作且看重安全就选 Hermes;喜欢亲手拼装、团队需要透明记录就选 OpenClaw。

Buzz — 用已装好的 CLI 驱动一支 AI 智能体团队
Buzz 是 Block(杰克·多西创办的公司)于 2026 年 7 月发布的开源协作应用,人与 AI 智能体在同一批频道里共事。界面几乎与 Slack 相同,但有一个关键差别:它不调用模型 API,而是接上你机器上早已安装并登录的命令行工具,例如 Claude Code、Codex、goose。于是你可以在已经支付的订阅额度内同时驱动多个智能体,代价是那台电脑必须保持唤醒。上手共六步:下载安装桌面应用;生成并妥善保管身份密钥;在「Set up your agent harnesses」页面接上至少一个 CLI;创建社区;用名称、指令和模型创建智能体;建频道、邀请智能体,然后用 @ 下达指令。智能体之间通过读写同一频道彼此交接任务,而它们执行的每一条命令都会先向你请求授权。

i-have-adhd —— 去掉 AI 回答开场白的插件
两条命令。在 Claude Code 里先用 `claude plugin marketplace add ayghri/i-have-adhd` 注册分发源,再用 `claude plugin install i-have-adhd@i-have-adhd` 安装,然后在会话里输入 /i-have-adhd,回答的形状就变了。开场白消失,第一行直接是要执行的命令或文件路径。多步骤的活儿以编号列表给出,最后一行留下一个两分钟内能做完的下一步动作。想让它每次会话自动生效,再执行一行 `touch ~/.claude/.i-have-adhd-always`。作者是 Ayoub G.(github.com/ayghri),MIT 许可的开源项目。名字里有 ADHD,但并不需要诊断——只要你常在长回答里找不到那关键一行,效果是一样的。

Notion 工程师是这样读代码的
不是逐行读 diff,而是先读智能体写的讲解文档,再用测验确认自己是否真的理解。这是 Notion 设计工程师 Geoffrey Litt 的日常做法,他也公开了工具本身——explain-diff 技能。装上之后,每次代码变更都可以生成一份 HTML 文档,顺序固定为背景、直觉、代码走读、五道选择题测验。安装只有两条命令:把 gist 里的 explain-diff-html.md 下载到 ~/.claude/skills/explain-diff-html/SKILL.md。之后只要说"讲讲这个分支改了什么"即可。产物会保存在代码仓库之外,文件名以当天日期开头。同一地址还有生成 Notion 页面的变体 explain-diff-notion.md。支撑这套做法的规则只有一条:测验没过,就不把代码交给团队评审。

可以用代码控制特斯拉吗 — 用 Fleet API 实现空调后吹自动化
可以。特斯拉提供名为 Fleet API 的官方车辆控制接口,车主授权账号后,程序即可执行上锁、开后备箱、空调、充电、导航目的地、哨兵模式等命令。最实用的第一个自动化是空调后吹:停车下车后让风机再运转一会儿,把蒸发器吹干。夏天那股酸味多半来自蒸发器上残留的水汽,所以效果立刻能闻到;而车机菜单里并没有这个按钮,甚至有服务专门把这一个功能做成按月订阅来卖。做法很简单:到家后调用 auto_conditioning_start 打开空调、set_temps 调高温度,十分钟后再调用 auto_conditioning_stop。真正的门槛不是代码而是注册流程 — 注册开发者应用、在自己域名的固定路径上托管公钥、运行为命令签名的代理。这类工作恰好适合交给 Claude Code 或 Codex 这类编程智能体,而费用则落在每个账号每月十美元的额度之内。

如何用回测验证YouTube上的投资论断 — 从字幕到免费行情API
当一段YouTube视频说"现在就是底部"时,除了相信或不相信之外还有第三条路:把论断转换成数字规则,放到历史数据里跑一遍。这就是回测。需要的工具只有两个 — 把视频字幕导出为文本的yt-dlp,以及无需注册和付费就提供每日收盘价的公开API(美股用纳斯达克,韩股用Naver金融)。步骤有三。先取得字幕,让论断以文字形式存在。再把"暴跌后反弹所以是底部"这样的人话,翻译成条件和数字:"从60日高点下跌超过35%的状态下,当日收盘比前日上涨20%以上,就在当日收盘买入"。然后把规则跑过十年数据。读结果时有两件事是必须的:对照组(如果只是一直持有同样的股票会怎样)和中位数而非平均值。没有对照组,在上涨的市场里任何规则看起来都不错;只看平均值,就会把少数几次暴利误认为是规则的实力。而如果某个论断根本无法写成数字条件,那不是验证失败,而是它本来就无法验证 — 做出这个判定本身就是结果。
npm run dev 和 localhost 是什么?——把自己的电脑当服务器运行
npm run dev 是在你自己的电脑上启动“开发服务器”的命令——它把你写的代码变成实时可看的网页。运行后,终端会打印出 'Local: http://localhost:3000'。这里的 localhost 不是别人的服务器,而是指“此刻你自己的这台电脑”(用数字表示就是 127.0.0.1),后面的 3000 是端口,也就是这个应用使用的那扇“门”。所以在这个地址打开的页面并没有上传到互联网,它只在你的机器里运行,只有你能看到。npm 是运行这条命令的工具(Node Package Manager):它下载项目 package.json 里列出的零件(包),并执行绑定在 'dev'、'build' 等运行名上的真正命令。对于刚拿到的项目,顺序始终是三步——npm install 补齐零件,npm run dev 启动服务器,再在浏览器输入 localhost:3000 查看。发布到互联网,是这一切都跑通之后的事。

本地部署 AI 何时需要,成本是多少
本地部署 AI 指的是把模型放在自己公司的设备上,只在自己的网络内运行,而不是调用别人服务器上的 API。需求来自两点。第一,无论数据是否被用于训练,数据经过的路径仍然留在外部。第二,发生安全事故时,前沿模型可能因护栏而拒绝分析。成本方面,运行一个前沿级开放权重模型,仅纯参数就需要 1.4TB 内存,需要相当于一个 72 卡机架的 H200 集群,按云端租用折算约每小时 300 美元,购买设备约 50 亿韩元。但这笔账要成立,前提是工作负载源源不断,能让 GPU 始终满载。所以实务上的答案不是全量迁移,而是只把不能外流的部分用开放权重放在内部,其余交给前沿 API。
Claude 的 Chat、Cowork 与 Code,何时用哪一个
Claude 有三个产品。Chat 是实习生,Cowork 是主管,Code 是爱因斯坦。三者都会对话、生成文件、连接工具,所以从外面看很像。区分它们的只有一点:工作在哪里结束。Chat 给出答案的那一刻就结束了,Cowork 不达目标不停止,Code 则创造原本不存在的东西。判断自己用错模式的信号也很明确——如果你正在把 Chat 的输出复制进文档、拼接碎片,那就是在手工做本该交办出去的活。
Impeccable 是什么,如何开始?——把设计规则装进 AI 编程工具
Impeccable 是一个开源工具,把 AI 编程代理在做界面时应当遵循的设计规范直接放进项目里。它起步于 Anthropic 公开的 frontend-design 技能,增加了 23 条命令和 60 条确定性检测规则,由 Paul Bakaus 以 Apache-2.0 发布。上手只需两行。在项目根目录运行 npx impeccable install,它会自动找出这台电脑上已安装的 AI 编程工具并列出来,再问是只装进当前项目还是装到全局。随后在工具里运行一次 /impeccable init,它会先问这次要做的是品牌向还是产品向界面,然后写出 PRODUCT.md 和 DESIGN.md,此后所有命令都会先读这两个文件。实际干活时用命令名下达:audit 做检查,critique 审视层级与可读性,polish 收尾,bolder 与 quieter 调强弱,distill 做减法;每天都用的命令可以用 /impeccable pin audit 固定成 /audit。也可以完全不用代理:npx impeccable detect 不调用 LLM、不需要 API 密钥,有问题以退出码 2 结束、没问题为 0,足以直接当作 CI 关卡。拿一张刻意写满常见毛病的示例 HTML 去跑,报出 17 条;只修被指出的项目后变为 0 条。

AI 做出来的界面为什么都长得差不多?——反复出现的特征与该怎么改
AI 生成界面的那股廉价感不是审美问题,而是一份清单的问题。模型大体上学的是公开网络上遍地都是的同一批 SaaS 模板,所以在没有额外指示时要一个界面,不同模型、不同项目会给出同样的选择。常见的有:卡片左侧一条粗色带、标题上叠的渐变、从紫到蓝的背景、彩色背景上的灰字、四散开的彩色光晕、卡片里又套卡片、标题上方的小号大写标签,以及 Inter 系字体,再加上 streamline、supercharge 这类套话。开源工具 Impeccable 给这些特征起了规则名,做成不依赖 LLM 的检查器。改法也简单:去掉色带,标题改回纯色,彩色背景上的文字用白色或该背景的深色调而非灰色,卡片嵌套改为留白加细分隔线。验证靠命令而不是眼睛。把这些特征刻意写满的一张示例 HTML 跑出 17 条;只修被指出的项目、保持布局结构不动,再跑就是 0 条。

把设计检查放进 CI 需要什么?——用退出码做成的关卡
关键是把设计评审从人的眼睛挪到退出码上。代码有 lint 把关,界面却每次都要有人看过才放行。Impeccable 的 detect 命令不调用 LLM、不需要 API 密钥,只跑规则检查,并用退出码报告结果:有问题为 2,没问题为 0。于是在 CI 工作流里写一行 npx impeccable detect src,不必安装专用 action 就成了关卡。检查方式随对象而异:HTML 会连同引用的 CSS 一起静态分析,JSX、CSS 之类的其他文件走模式匹配,给网址则用真实浏览器读渲染后的画面。所以源码扫描干净,网址扫描仍可能查出别的项目,把预览部署地址一并接上就能补上这段落差。日常够用的选项有四个:json、scope、viewport、no-advisory。需要例外时,用文件内的 impeccable-disable 注释就地豁免,或用 ignores add-value 记进仓库配置——两种方式都要写下理由,判断因此以记录的形式留存。

如何判断回测收益率是不是真本事——持仓占比与暴露调整后的阿尔法
把持仓占比摆在收益率旁边,再用策略收益率减去持仓占比乘以买入持有收益率。剩下的部分就是市场暴露无法解释的那一块,也就是阿尔法。持仓占比指回测期间实际持有仓位的交易日比例。缺了这个数字,只看收益率就无法分辨策略是判断对了才赚到,还是仅仅因为大部分时间不在场。把五种广为流传的技术分析方法放到十六个标的上做前推回测,差别一目了然。五种全部没能跑赢买入持有,胜率最高的也只有34.5%。而且标的本身在该区间的涨幅与策略超额收益呈现负0.945的相关性——标的上涨策略就输,标的下跌策略就赢。原因在于暴露。一年期窗口的平均持仓占比为23.8%,其余时间是现金。暴露调整后的阿尔法中位数为负5.73个百分点,回归截距为负0.52个百分点,实际上等于零甚至更低。本文把这套验证整理成可以从头复现的步骤与算式。
让 AI 代理回测交易规则前,必须先说清楚哪些事?
回测就是把自己的交易规则套用到过去的行情上,算出如果真按这套规则买卖,现在账户会是多少钱。用 Toss 证券 Open API 的 K 线接口取回日线的开高低收,再把规则用大白话讲给 Claude Code 或 Codex 这类终端 AI 代理,几分钟内就能拿到成交明细和收益率。但真正决定结果的不是规则,而是你没有说明的假设。判定时点、成交价格、交易成本、数据区间这四项若不钉死,代理不会反问,它会悄悄挑一个最像样的值填上,而那个选择就成了你的业绩表。实测中,同一套规则、同一份数据用在三倍杠杆 ETF 上,只改动平仓成交假设一项,五个月收益率就在 15% 与 95% 之间分开。

Fable 5、GPT-5.6 Sol、Kimi K3:单价相差 3.3 倍,实际成本也相差 3.3 倍吗?
并非如此。按每百万 token 计,Claude Fable 5 的输入为 10 美元、输出为 50 美元,GPT-5.6 Sol 为 5 美元与 30 美元,Kimi K3 为 3 美元与 15 美元,最贵与最便宜的一档在输入和输出上都正好相差 3.3 倍。但真正决定账单的是价目表之外的三件事。第一是同一段文字会被切成多少 token:Anthropic 说明 Claude 4.7 及之后的模型改用新分词器,对同样文本会多产生约 30% 的 token,单价不变而计费数量上升。第二是长度是否改变费率:Sol 的输入超过 272,000 token 时,整个请求按输入 2 倍、输出 1.5 倍计费,折合每百万 10 美元与 45 美元,而 Fable 5 与 Kimi K3 的价目表中根本没有长度分档。第三是结果能否一次到位,因为每一次重试都会把单价再乘一遍;在一份对三个模型只给同一条提示词各跑一次的评测中,物理处理与画面细节明显是 Fable 领先,Kimi 与 Sol 则彼此接近。此外三家的缓存命中折扣完全一致,都是输入价的 10%,所以缓存只会让三者一起变便宜,并不会缩小彼此的差距。

什么是能力悬置,组织该做什么?
能力悬置(capability overhang)指的是:AI 工具能处理的工作范围每隔几个月就大幅拓宽,而使用者的能力增长要慢得多,于是两者之间不断堆积着“没被用起来的性能”。由此得出一个结论:把同样的工具平均发下去,用得好的人和用得一般的人之间的生产力差距不会缩小,反而会拉大。因此组织里 AX 的真正课题不是引入工具,而是管理这个差距。该看的指标也不是使用率,而是分布。
要让 AI 通过 Toss 证券 Open API 交易股票,需要准备什么?
Toss 证券 Open API 是一套 REST API,涵盖行情与个股信息、账户与持仓、下单与改单撤单,以及监视价格并在触发时自动下单的条件单。登录 Toss 证券 WTS,在设置中的 Open API 菜单里签发 client_id 与 client_secret,并把调用来源 IP 登记到允许列表,准备工作就完成了。再接上 Claude Code 或 Codex 这类终端 AI 代理,就可以用自然语言描述交易规则来自动化查询与下单,而不必自己写代码。但查询一旦打通,下单也随之打通,所以在真实下单之前必须由人先设好闸门:默认演练模式、显式执行标志、金额上限与幂等键。

为什么配齐了 AI 工具的组织依然快不起来?
因为决定速度的不是工具,而是完成标准与审批结构。金融科技公司 Block(Square 的母公司)把 AI 编程工具交到了三千五百名工程师中的大多数手里,产品发布周期却几乎没有变化。瓶颈从来不是缺少工具,而是工程师对 AI 所写代码的信任度,以及压在其上的审批流程。Anthropic 则从另一端入手,创造了名为「研究预览」的发布单元,去掉审批等待,把产品周期从五到六个月压缩到一到三天。用帕累托法则重读,规则便清晰了:八成核心功能只需两成工期,剩下八成工期用于把 80 分抬到 100 分,而这段打磨市场几乎从未被问过是否需要。在八成处发布,让市场反馈决定最后两成,初期项目周期便缩短为原来的五分之一。

Record a skill 是什么,该怎么用?
Record a skill 是 Claude 桌面应用中的功能,它把屏幕、点击、键入和语音一起录下来,再把这段过程变成 Claude 可以重新执行的「技能」。你不必用提示词描述流程,只要照平时的做法演示一遍。Claude 会先总结这是个什么工作流,请求所需的文件夹与连接器权限,然后保存为可复用的技能。之后只要一句「这周的也整理一下」,同样的工作就会重跑一遍。限制在于录制期间屏幕上出现的一切都会被发送,因此会露出密码、账户或私人对话的工作不适合使用。

怎样写一份 Claude 真正会遵守的 CLAUDE.md?
CLAUDE.md 不是被强制执行的配置,而是每次会话都会一并读入的指令集。因此往一个文件里堆得越多,规则之间就越互相竞争,重要的指令被琐碎的淹没,Claude 反而遵守得更差。让它奏效有五点。第一,先问 CLAUDE.md 是否合适——像“绝不推送到 main”这样的硬性规则应放进 pre-tool-use hook,而不是写成指令(hook 会在 Claude 尝试时真正拦下)。第二,CLAUDE.md 存在于四处——managed policy(组织)、user(你机器上的所有项目)、project(与团队共享)、local(本仓库中只属于你、被 git 忽略)。它们全部一起加载,所以把个人的、临时的决定放进 local。第三,用 @路径 import 拆分——但 import 在启动时就地内联展开,只帮你整理,并不减少上下文。第四,措辞决定遵守度——要具体、可核对(“新的 API 路由放在 src/api/handlers,一文件一个”,而不是“遵循最佳实践”),并指名替代方案(“使用具名导出”,而不是“不要用默认导出”)。强调是一种预算:IMPORTANT 和 YOU MUST 只用在两三条打破就会痛的规则上。第五,持续修订——Claude 做错时,把它当作针对 CLAUDE.md 的缺陷报告,让它把规则补进去。像对待生产代码一样,删掉任何你无法自证其价值的行。文件越精简,Claude 遵守得越多。

Claude Opus 5 是什么,有何变化?
Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的顶级通用 AI 模型。重点在于'以一半价格获得前沿智能':它以约一半的成本接近最强模型 Claude Fable 5。价格为每百万输入 token 5 美元、每百万输出 token 25 美元,与上一代 Opus 4.8 相同,但性能大幅提升,在编程、知识工作、计算机操作和业务自动化基准上创下新高。不过在安全、生物学等专门领域,专用模型 Mythos 5 仍然领先。

如何驾驭长达数小时的 Claude Code 会话?——Plan、Compact、Rewind、Goal、Loop、Worktree
短任务你可以下达指令后看它跑完,但长任务——跨十几个文件的重构、要花数小时的新功能——不是撒手不管,而是要去“驾驭”。两个习惯支撑它:在 Claude 开始前界定范围,在运行中把握方向。六个工具让这成为可能。Plan Mode 以只读方式调研并交给你一份方案;读它、改它,执行时的差错就更少。Compact 把对话总结成新的上下文并删掉旧的,腾出上下文窗口——而在命令后加上指示,能告诉 Claude 保留什么,从而不丢失要紧内容、不偏离。Rewind 让你回到某个检查点(在空提示上连按两下 escape),恢复代码、对话或两者,或总结该点之前或之后的一切。Goal 设定完成条件:描述“完成”的样子,Claude 就会持续跨轮工作,直到一个快速评估器确认满足,而不是在它自认为完成的第一刻就停下(评估器只读对话记录,所以条件必须能从 Claude 的输出中核对)。Loop 按间隔运行一个提示,用来盯住 CI 运行或部署等外部状态,并在其变化时作出反应。Worktree 给多个代理各自一棵独立的文件树,以免它们争夺同一个仓库。先界定范围,再去驾驭,你就能信任一次长时间运行而无需守着它。

什么是 Claude Code 权限模式,何时可以用 auto 放手不管?
权限模式(permission mode)一次性决定 Claude Code 在不必每次征得你同意的情况下可以运行什么。一共有六种。manual 只读,其余一切都要询问。acceptEdits 对读取、文件编辑以及常见的文件系统命令不再逐次询问,让你事后一次性审阅。plan 只读并调研以提出方案,但不做编辑。auto 会执行一切,同时由一个独立的分类器模型在每个动作执行前进行审查,只拦截危险动作——这是放手不管的默认选择。dontAsk 只允许预先批准的工具,其余一律不提示直接自动拒绝,适合 CI 和夜间批处理。bypassPermissions 跳过所有检查,等同于 dangerously-skip-permissions,只应在隔离的容器或虚拟机中运行。按 shift+tab 在 manual → acceptEdits → plan → auto 之间循环,状态栏会显示当前模式。auto 的分类器守护的是意图,却无法判断代码是否正确,因此要与运行测试的 stop hook 搭配使用:分类器盯意图,hook 确认正确性。归根结底,放手到什么程度要按任务来定,而不是凭胆量,并为其选择合适的模式。

什么是 Vibe Coding?从工具到部署的整条路径,如何折进一张地图?
Vibe Coding 是指用自然语言告诉 AI 你想要什么,从而构建网站或服务,而不是自己逐行敲代码。初学者感到迷茫,不是因为某个工具很难,而是因为脑中没有各部分如何拼合的整体图景。这张整体图景折成一张地图。第一是工具:像 ChatGPT、Claude 这样的 LLM 是训练好的大脑,编程代理(coding agent)是装上这个大脑、真正在电脑上创建和修改文件的手脚,如今单是 Claude Code 一个工具就能独立承担这个角色,无需另开终端或编辑器。第二是前端(你看到的界面):只要把服务的大致规模告诉代理,它就会挑选合适的技术栈。第三是后端(界面背后存储与处理数据的服务器):大多数人在这里放弃,但 Supabase(数据管理者)和 Vercel(部署管理者)会替你越过这道墙。Git 与 GitHub 处在中间,负责保存你的工作并存入网络仓库。最终地图折成三行:工具是 Claude Code;前端说明规模、交给它选栈;后端交给 Supabase 和 Vercel。

Scrapling 是什么,为什么网站改版后它的爬虫也不会失效?
Scrapling 是一个用 Python 抓取网页数据的开源框架(BSD-3 许可证,GitHub 星标 7 万)。最大的特点是自适应选择器。普通爬虫靠指定页面上的位置来取数据——'抓取带这个类名的元素'——所以当目标网站改版、类名或结构发生变化时,这些规则全部失准,只会返回空值。Scrapling 在首次抓取时把元素的特征一并保存下来,下次运行时打开 adaptive 选项,就用相似度算法重新找回移动了的元素。于是网站变了,人也不必再去改选择器。此外,一个库里还打包了对 Cloudflare 这类反爬墙的绕过、大规模并发爬虫,以及可接入 Claude、Cursor 的内置 MCP 服务器。
.gitignore 和 .env 是什么,为什么必须在第一次提交之前就建好?
.env 是把 API 密钥、密码这类不能让别人看到的值从代码里挪出来存放的文件;.gitignore 则是告诉 git「这些文件永远不要上传」的清单。两者都要在项目第一天、第一次提交之前建好。写进代码里的密钥一旦推送到 GitHub 就等于公开,而扫描公开仓库、专门抓密钥的自动程序几分钟内就能找到它。如果已经上传了,比删文件更优先的是重新申请密钥——git 历史里仍然保留着旧的那一个。

AI 时代留给人的能力是什么
交给 AI 的是给出答案和给答案打分,留给人的是决定该给什么打分。当下 AI 业界出价最高的资产,是各领域专家的判定标准,也就是被称为 eval 与 verifier 的评分表。但评分表一旦被提取就会被复制,而打分本身也正在以模型评判模型的方式迅速自动化。不被自动化的那一层在其之上:选择往哪里看的好奇心,和选择什么算好的品味。两者都是设定目标函数的行为,而模型无法自己写出目标函数。
Vibe Coding 原则 —— 要让 AI 把代码写好,你得先定好什么
让 AI 把代码写好的原则大致有八条:安德烈·卡帕西的四条(先想再做、不加多余、只改该改的、目标驱动)和让代码整洁的四条(SSOT、DRY、KISS、YAGNI)。这八条其实可以折成四条常识——动手前先确认、保持简单、只动交办的部分、归拢到一处。把它们写进一个 CLAUDE.md 或 AGENTS.md 文件(即 harness),AI 每次对话开始时就会先读它。可以把它们想成贴在一个能干却没眼力见的新人桌上的便签。

什么是 Vibe Coding 的 harness(AI 使用框架)?非开发者应该先设置什么?
harness 是你事先写进项目、让 AI 按照你的水平和处境来工作的一套规则与说明。对于刚开始做 Vibe Coding(不自己写代码、而是指挥 AI 来做软件)的非开发者来说,最先要做的 harness 设置只有一行:在项目文件夹里新建一个名为 CLAUDE.md 或 AGENTS.md 的文件,写上“我不是开发者,请把专业术语用通俗的话解释清楚,并且尽量简短”。AI 会在每次对话开始时先读这条指令,于是每个回答的深浅都会随之改变。
做 Vibe Coding 时,为什么把一个项目放在单个文件夹里?
因为文件夹是 git、harness 与部署共享的边界。文件系统是一棵树,所以一个文件夹就是一根有边界的封闭分支(subtree),而 git 仓库(每个根一个 .git)、AI 规则文档(CLAUDE.md、AGENTS.md)和部署(一个 commit SHA)都复用同一个文件夹边界。因此一次 push 就同时完成保存、应用规则与部署。标准做法是把项目并排放置而非嵌套,并从各自文件夹的根目录开始工作。

什么是“AI洗白”?裁员的真正原因是什么?
“AI洗白”是指企业将由业绩压力、组织臃肿等真实原因导致的裁员,包装成“AI导致的裁员”。今年上半年,美国明确以“AI”为由的裁员超过10万人次,但在对700位CFO进行的匿名调查中,90%的人表示AI在过去一年里对公司招聘几乎没有实质影响。真正发生的并不是AI直接取代了人,而是少数善于使用AI的人做了原本需要多人完成的工作,从而关闭了尤其是应届生和初级岗位的入职大门。
如何交叉核验一则新闻是真是假
同一则新闻出现在多家媒体,并不等于交叉核验——多数只是转发了同一条通讯社稿件。此插件接收新闻链接,抽取核心主张,并用彼此独立的来源逐一比对,判定真伪。判定由代码计算,而非 AI 的直觉(独立支持 ≥2=真,独立反驳 ≥2=假,否则无法核验),通讯社转发会被合并为一个。它能读取被反爬拦截的网站,是一款开源(MIT)的辅助工具。
仅凭一段视频,如何反向定位 Instagram Reels 里的地点
宣传用的 Reels 要吸引人,所以画面里留下大量线索。此技能从视频中抽取帧,让 AI 读取这些线索(招牌、地标、字幕、文案),同时检索 Kakao 地图、Naver 博客与上传者账号来缩小候选,再对每个候选尝试反证后才确认地点。在 Claude Code 中以插件安装,给它一个 Reels 链接即可。仅面向宣传公共场所的内容,且为开源(MIT)。
K Public Data MCP 的医院详情查询新增了什么
K Public Data MCP 是一个让 AI 直接使用韩国公共数据的开源 MCP 服务器。此次接入了韩国健康保险审查评价院(审评院)的“医疗机构详情服务”,在按名称、地区、类别检索医院之后,可一次性查询该医院的设施与床位、各科室专科医生人数、拥有的医疗设备(PET、CT 等)以及交通信息。原本止于检索的数据,现在延伸到医院“内部”。
什么是 Claude Code Remote Control——用手机接管本地会话
Claude Code Remote Control 让你把正在自己电脑上运行的 AI 编码会话,用手机、平板或另一个浏览器接管过来继续下达指令。会话依然在你的电脑上运行(不在云端),代码执行与文件访问也留在你的设备上。手机和浏览器只是查看这个本地会话、向它说话的窗口。在项目文件夹里敲一行 claude remote-control,就会出现会话 URL 和二维码;用手机扫二维码,该会话就在 Claude 应用中打开。它可用于 claude.ai 的 Pro、Max、Team、Enterprise 订阅,截至 2026 年 7 月为研究预览(research preview)。

ir-search 是什么——对政府扶持项目做全量普查的 AI 技能
ir-search 是一个对韩国政府与公共机构扶持项目做‘全量普查’的开源智能体技能。它整段爬取 K-Startup、企业마당(Bizinfo)、NIPA、KOCCA、SMTECH 的在招公告,按你的项目画像(创业阶段、地区、所需)筛出合适的项目,再对每份详细公告原文逐条核验资格,最后分成三组产出报告:现在即可申请(A)、达成条件后开启的路线图(B)、改写措辞即可符合(C)。它在 Claude Code、Codex、Cursor、Gemini 等多个智能体上一行安装、一行运行,为每份公告附上原文 URL,公告中没有的信息不臆测而标为‘不明’。作者(djfksjd)以 MIT 许可开源。
AI 做出来的注册功能里缺了哪五样东西?
你只用一句话让 AI‘用邮箱和密码做个注册功能’,画面五分钟就出来了,但那份成果里缺了五样东西:找回密码、会员信息修改、注销退会、隐私政策、服务条款。这不是再加一个功能的问题,而是定政策的决策问题。重置链接有效几分钟、注销的数据是真删还是只匿名化、隐私政策是否按实际收集的字段来写——这些都得由人先定,AI 才能照做到位。漏掉注销或隐私政策,就是违反个人信息保护法、要被罚款。AI 时代,做东西的人的实力不来自代码,而来自这份决策清单。
如何用 GPT Live 做实时同声传译
GPT Live 是 OpenAI 推出的新 ChatGPT 语音模型。得益于“全双工(full duplex)”结构——一边听一边说,它能在对方说话的同时判断何时插话、何时退让,实时同声传译因此才变得自然。用法很简单:在 ChatGPT 应用里打开语音模式,用一句话下指令“从现在起把我说的韩语立即翻成英语”。发言者说韩语,AI 当场译成英语送进对方的耳机,即便两人声音重叠也不会中断。这项功能连免费用户都开放了,翻译曾是花钱和请人的问题,那个时代正在落幕。
什么是企业大脑(Enterprise IQ),为什么 AI 转型不是把 AI 插进流程
AI 转型能否成功,不取决于把 AI 插进现有流程的哪个环节,而取决于是否把公司自身在市场上取胜的独有逻辑——BCG 所说的“企业大脑(Enterprise IQ)”——植入 AI。多数企业止步于“插入式(deployment)”:流程顺序不变,只在各步骤之间塞进 AI,结果只是手脚变快。BCG 所说的“重塑(reshape)”则重新设计流程本身,把新产品规划从半年到一年压缩到一两个月。让这种重塑成为可能的大脑,OpenAI 和 Palantir 都造不出来,只有懂自己市场逻辑的公司才造得出。
在客户能自己开发的时代,外包开发公司留下什么?
在客户能用 AI 自己动手开发的时代,外包开发公司留下的不是成品,而是‘做判断的关口’和‘让客户自己能做的培训’。AI 开发公司 Litmus 打造了这样一套结构:客户在画面上点击想改的地方并留下评论,评论立即变成一张工单,智能体随即开始开发;项目成熟后,由 PM 在关口判断哪些采纳、哪些拦下。SH Consulting 沿用同一骨架,不把 RFP 百分之百实现后交付,而是只做核心的 80%,剩下的 20% 通过 AX 培训帮助客户自己收尾与维护。AI 越是接管执行,开发公司的价值就越从代码转向判断与教学。
为专业事务所接入 AI 智能体后,会有什么不同?
为专业事务所接入 AI 智能体,意味着重新设计工作流程:让 AI 处理位于专家‘判断’之前的重复工作——受理咨询、对案件或咨询类型进行分类、初步梳理风险,而人则专注于判断与担责。拥有 21 年检察官经历的李永男律师的事务所网站 thechain.lawyer 就是一个案例。访客写下自己的情况后,AI 咨询智能体会区分案件类型,初步整理出争点与风险,再交给律师,律师在这份已整理好的语境之上只做判断。由于资深者的直觉原封不动,被剥离的只是它前面的重复,因此 AI 是在增强专家,而非取代专家。
AI 生成的结果,该理解到哪一步,又该在哪里就此打住?
用 AI 工作时,不要试图理解一切——先划清哪里该继续深挖、哪里该就此打住。想全部弄懂,反而会让你自己的理解成为瓶颈,把活儿拖慢。核心技能是用廉价的重复验证来买信任,而非深度理解。比如向同一个 AI 三次追问'这真的对吗?',若三次都说对,就信任并翻篇。只有对出错即致命的地方——资金流、安全、合同——才把验证闸门设得更严。本文按步骤,为第一次上手的人讲清:如何划这条线、如何真正地跑'追问'、以及该盖住什么、该留下什么。
什么是 Claude Design?非开发者该如何上手?
Claude Design 是 Anthropic 推出的 AI 设计工具,只需像聊天一样对话,就能生成网站、原型、演示幻灯片、广告和文档,属于 Anthropic Labs 目前处于研究预览阶段的产品。它由 Claude 的前沿模型驱动(本文所参考教程中为 Opus 4.8),面向 Pro、Max、Team 和 Enterprise 订阅用户开放,可在 claude.ai 侧边栏或 Claude 桌面应用中使用。核心在于先建立一套「设计系统」,把品牌的字体、颜色和 Logo 固定下来,之后所做的一切都以同一种统一风格产出。设计完成后,把它交给 Claude Code 变成真正的代码并部署上线。本文以初次接触者的视角,一步步演示一个人如何在没有设计师或视频剪辑的情况下,产出一整套品牌资产。

HITL:AI 连规划、开发都做了,人为何还留下?
AI 的业务自动化正从重复执行延伸到新服务的规划与开发。AI 客服机器人会附上依据,自动处理那些仅占咨询种类 20%、却占实际工作量 80% 的重复咨询(帕累托 8:2)。更进一步,在 AI 监测社区舆情、自动规划并开发新服务的流水线里,人只留在'Go/Stop 决定'与'功能测试'两个判断点上。这种让人留在自动化闭环中做判断的结构,称为 HITL(Human In The Loop,人在回路)。机器承担从执行到规划,人的工作收敛为判断。
GPT-5.6 Work 与 Claude Cowork,谁更擅长工作自动化
一位 AI 教育创作者给 GPT-5.6 和 Claude Fable 5 相同的提示——做一个实时拉取 YouTube 数据的仪表盘——并加以比较。两者性格分化:Claude 不择手段、快速交付想要的结果;GPT 想得更久、更求稳,甚至用新的 Site 功能把成果部署成真正的服务。但真正重要的变化在结构,而非产出。过去需要人手搭建的 harness(子智能体、技能)正被吸收进工具本身,用户不必再懂这个概念——这实质性地降低了企业 AX 落地的门槛。
特斯拉 HW3 与 HW4,FSD 性能到底差多少
一段用特斯拉旧硬件(HW3)和新硬件(HW4)在同一路线上分别开启自动驾驶进行对比的视频显示,日常驾驶中两代之间几乎没有差别。在往返市区与高速的全程中,方向盘和踏板都没有介入,自 2025 年初起就停留在同一 FSD 版本(v12.6.4)的 HW3 也开得和 HW4 一样顺畅。HW4 与 v14 的真正优势(推理快 3~5 倍、重写 MLIR 编译器、可从驻车挡起步)体现在应急车辆、复杂泊车等棘手的边缘场景。结论是:对绝大多数车主而言,HW3 依然够用。

写给 Vibe Coding 新手的 Git:先学什么
Git 是管理代码版本的工具。它让你在出错后回到之前的状态、保留你所做工作的历史记录,并在不动原稿的情况下安全地做实验。新手只需掌握三块。第一,用 add 和 commit 把满意的时刻定格为一个版本。第二,用 diff 和编辑器 GUI 在提交前查看改了什么。第三,用 branch 复制一份先在上面开发,跑通后再合并回去。安装只需一行,要记的命令也就几个,而且可以直接用 VS Code 的 GUI 起步,不必执着于终端。
企业引入 AI,为何总是走不到实际业务
企业的 AI 引入停在 POC 阶段,原因不在技术,而在结构。若在原有工作之上把 AI 应用当作额外工作硬加上去,又没有专职团队和实验时间,就只能得到一个看似像样、却始终无法进入实用的原型。业界称之为 POC 的诅咒。成败取决于公司是否设有专职做 AI 的团队,以及能否验证结果的领域知识。与其想做出宏大的东西,不如先把自己每天重复的一小块工作交给它。
在 Vibe Coding 中,Skill、CLI 和 MCP 到底有什么不同
Skill 是用 Markdown 写成的指令书,告诉 Claude 该怎么做;CLI 是模型在训练数据里早已烂熟于心的终端命令;MCP 则是把认证、权限、工具说明封装进标准规格、用来连接外部服务的协议。三者不是互相竞争,而是分层叠加:Skill 决定方法,CLI 或 MCP 负责实际执行。
Claude Cowork 移动版:到底变了什么
Claude Cowork 现在支持网页和移动端。它在 Anthropic 的服务器上远程运行,因此关掉笔记本后任务仍会继续,你可以用手机接着处理。定时任务可以提前生成晨间简报,只等你做决定;桌面应用则把 Chat 和 Cowork 合并进同一个主页。需要注意的是,网页和移动端只能使用与你账户相连的云端资料,而本地文件和浏览器操作仍需桌面应用保持打开。

为什么vibe coding的本质是把尽可能多的事甩给AI
vibe coding的核心,是不要把AI本来能做的事揽到自己身上。初学者一听到AI说“安装git”“配置Vercel”,就自己动手去做,结果被折腾到精疲力尽。但这些事大多AI自己就能做——“你去装”“你去配”“你自己去确认”,一句话,代理就帮你搞定。只保留像注册账号这种只有本人能做的事,其余的一律甩给AI,直到它真的说做不了为止。这才是vibe coding里“委托”的真正含义。
把 AI 编程推广到每一位员工时,组织需要重新设计什么?
在全公司部署编程智能体的真正挑战,不是发放工具,而是重新设计其后浮现的瓶颈。DoorDash 把 Claude Code 发给了每一位员工,而不只是工程师;当吞吐量上升后,CI/CD、代码评审和安全成了新的瓶颈,又必须用 AI 逐一自动化。三条组织层面的经验尤为突出:学习只通过书面产出物扩散,实验团队需要高管层赞助,AI 冠军应当自发涌现而非自上而下任命。AX 不是购买工具,而是组织如何重新设计编程变快后才浮现的瓶颈。
非开发者开始vibe coding时,为什么git是第一道难关
非开发者开始vibe coding时,往往先撞上的不是代码,而是git这堵墙。因为向Claude Desktop请求执行代码时,首先跳出来的提示往往是“请先安装git”。git是一种版本管理工具,记录代码的每一次改动,让你随时能回到之前的状态——即便AI把代码搞砸了,也有办法恢复。问题不在于概念难懂,而在于安装本身。每个人的电脑环境和熟悉程度都不同,大多数人卡在安装界面的某个选择上就动弹不得。正因如此,把git的安装这件事本身交给Claude Code去做,反而成了vibe coding真正意义上的第一次实操。

Claude Code 与 Codex,究竟在哪里、怎么用?
像 Claude Code 和 OpenAI Codex 这样的编程代理,在四种界面上使用:用按钮而非终端来驱动的桌面应用、附着在你已在用的编辑器上的 VS Code 扩展、一路延伸到自动化的 CLI,以及像 Cursor、Replit 这类从一开始就内置了代理的 IDE。同一个模型,用在哪种界面上,行为就不同。在终端里它变成自动化,在桌面应用里它变成对话。所以,选界面在选工具之前。
在氛围编程中遇到的文件格式,该如何区分?
非开发者在氛围编程(vibe coding)中遇到的数十种文件格式,其实只分三类:装数据的容器(CSV、JSON、XML)、在屏幕上呈现的东西(HTML、Markdown),以及设置与机密(YAML、.env)。你不必逐一背下每个扩展名。遇到陌生文件时,只要判断「这是数据、画面,还是设置」,入门门槛就消失了一半。
如今 AI 模型真正的前沿由什么定义?
AI 模型的前沿如今不再由基准测试的准确率定义,而由「在混乱的真实环境中长时间存活」的能力定义。在真实工作的混乱中自行保持航向——积累数十年的遗留工具、必须永远正确的法律与金融文书、跨越数小时的自主运行——才是这次跃迁的核心。其结果是,企业采用 AI 的瓶颈从「模型是否足够聪明」转向「我们如何把组织中混乱的上下文交给模型」。
AI 时代的护城河(moat)留在哪里?
AI 时代的护城河正从「你知道什么」转向「你能多快弥合差距」。当前沿实验室把专家的隐性知识作为 post-train 数据买入、AI 又直接进入各领域时,领域知识本身与模型可及性都难以成为可持续的护城河。真正留下来的,是两种速度的赛跑——领域专家吸收 AI 的速度,与 AI 原生者追赶领域知识的速度——护城河属于率先弥合差距的一方。
为什么AX的最大受益者可能是50多岁的人
AX(AI转型)的最大受益者,也许不是熟练使用AI工具的20多岁年轻人,而是早已亲身掌握业务流程(work flow)的50多岁的人。AX的本质不在于会不会操作工具,而在于重新描绘业务流程;当懂流程的人拿起工具时,产出的差距会拉得最大。事实上,在AI已经普及的围棋界,水平并没有向上看齐,反而是顶尖与末位之间的差距进一步加剧了。

什么是Advisor Strategy,它与opusplan有何不同
Advisor Strategy让低成本模型负责执行,只有在判断卡住时才按需调用更强的模型来获取建议。Claude Code CLI的opusplan采用同样的思路,但把这种交接固定在计划与执行的边界上,执行过程中没有让更强模型重新介入复核的循环,这是两者的关键差异。
AI培训之后,怎样才能让所学真正留下来?
AI培训只有从学员真实所处的水平开始,并在培训结束后配上一个定期复盘的副业项目,才能真正留下来。跳过阶段的学习在课程结束的瞬间就会蒸发,没有复盘的练习也会被更紧急的事情挤掉。
高尔夫空位提醒机器人为何能变成一人服务
GolfShin 每小时检查韩国 34 家高尔夫球场的预订页面,一旦出现空位就通过 Telegram 通知用户。在 Telegram 机器人(@golfshinbot)登记想要的球场、日期和时间段,即可免费收到提醒,无需登录。这是申丞浩独自开发并运营的副业项目,展示了曾经需要一个开发团队才能完成的自动化,如今如何由一个人独立承担。
什么是Claude Tag?AI为何正从个人工具走向团队基础设施?
Anthropic公开的Claude Tag是一种智能体:在团队频道(Slack,很快还有Teams)中用@Claude呼叫,它便常驻并自主工作。它浓缩地展现了AI从「你打开并提问的反应式个人工具」转向团队基础设施的过程,而推动这一转变的不是更聪明的模型,而是常驻、持久记忆与多人协作这样的环境设计。
从Spotify运用AI智能体的方式,普通白领能学到什么?
Spotify让AI直接编写73%的代码改动、却依然保持质量稳定,靠的是三件事:验证先行的自动化、标准化,以及把腾出来的时间重新分配。这些原则并非软件开发专属——同样直接适用于写报告、写邮件等日常办公室工作。
AI时代的团队为何要按"原型"而非"职位"来搭建?
随着AI让工程、产品、设计、数据角色相互融合,真正区分团队成员的已不再是职位名称,而是五种工作方式之一:原型师(Prototyper)、建造者(Builder)、清扫者(Sweeper)、培育者(Grower)和维护者(Maintainer)。大多数人同时跨越两到三种原型,而团队需要的组合会随产品所处阶段而变化。
对 AI 智能体来说,为什么 AGENTS.md 比 Skill 更管用?
如果让 AI 自己决定要不要翻开文档,它有一半时候不翻,于是出错。像 AGENTS.md 那样在项目里始终摊开,就没有做选择的那一刻,也就没有出错的余地。在 Vercel 的实验中,需要时才取用的 Skill 即便强力指示也只有 79 分,而始终摊开的 AGENTS.md 得了 100 分。AX 真正的胜负手,不是把工具做得更聪明,而是从设计上消除出错的机会。
网络分离政策的终结对韩国企业提出了什么要求
韩国维持二十年的统一网络分离政策,在2026年5月通过国家网络安全指南修订被废除。要点不在于放松监管,而在于企业再也无法回避一直拖延的功课:数据分类。要连接网络,就必须把数据分为国家安全、敏感、公开三个等级,而韩国从未真正做过这种分类。况且封闭网络早已被影子AI攻破。阻碍AI引入的真正瓶颈既不是模型也不是基础设施,而是没有人整理过我们究竟持有什么样的数据。
韩国AI初创企业在欧洲靠什么取胜
韩国AI初创企业带到欧洲的武器不是更聪明的模型性能,而是信任。VivaTech的K-Startup展区六个团队领域各异,从企业内部文档检索到工厂设备数据、3D数字孪生压缩、香氛推荐、皮肤诊断、同声传译。但它们给出了同一个答案:数据不外传的本地化部署架构、符合ISO和GDPR的合规,以及已经握在手中的PoC案例。不是炫目的演示,而是能在现场运转的AI,才是划分幻想与实效的那条线。
当 AI 智能体读不到被拦截的公开页面时,问题出在哪里?
AI 智能体读不到公开页面,问题通常不是内容缺失,而是默认抓取一遇到 403 或反爬信号就放弃。insane-search 是一个 Claude Code 插件,它不预先认定页面被封,而是依次尝试公开 API 与订阅源、轻量探测、TLS 指纹伪装,直到真正的无头浏览器,直到某条路径成功为止。但它在登录墙和付费墙前停下,报告需要身份验证。它是公开内容的阅读器,而不是绕过身份验证的工具。
AI时代,为何每位员工都要从「砌砖工」升级为「建筑师」?
至今为止,大多数上班族都是砌砖工——照着别人画好的图纸不断重复。AI改变了这一格局:正如员工可以自己搭建MCP工具、个体商户可以一键(1-click)发布内容,如今任何人都能成为设计自己系统的建筑师。在我看来,AX真正的目标不是某个自动化百分比,而是让组织里的每一个人都从砌砖工升级为建筑师。
我亲手打造并公开的五款日常自动化工具是什么?
为了让每个人都能把自己的日常自动化,我亲手打造并公开了五款工具——从四柱算命、基于性格测试的综合咨询、公共数据整合、卡片新闻生成,到养老金模拟。它们并不是什么宏大的平台,而是「只做需要的工具、只做需要的那么多、并且做得快」的产物,出发点是我相信:AX的终点,是每个人都成为自己系统的架构师。
如何防止编程智能体假装完成并共享盲区?
编程智能体的失败有三种反复出现的形态——假性完成、未达成共识的设计、单一模型的盲区——而每一种都用一层工程框架(harness)来堵:共识、验证、交叉评审。开源框架 oh-my-claudecode(OMC)提供 ralplan,在动任何代码前强制计划通过 Planner-Architect-Critic 的共识循环;提供 ralph,只有在独立评审者逐条验证用户故事后才宣布完成;提供 ccg,用一个模型补另一个模型盲区的交叉评审。AI 成果的差距通常来自框架,而非模型。
AI 是裁减人力的剪刀,还是让人更强的铠甲?
在企业培训现场,我最常被问到的问题是:「引入 AI,是不是就要裁人?」我的看法恰恰相反。AI 不是裁减人力的剪刀,而是让同样的人变得更强的铠甲;武装了 400 人的组织,会赢过裁到 100 人的组织。裁减只是一次性的节省,而武装会以复利累积。
在 AX 中,人与 AI 的角色如何分工?
在 AX 中,人决定往哪里挖,AI 则用数据快速检验这个假设是否成立。AI 的真正价值不在于产生好点子,而在于诚实地否定错误的假设。在用医疗数据构建选址模型时,AI 智能体用数据否决了一个看似合理的饱和假设,而一位领域专家的一句话指出了真正的信号。两者的结合才是 AX 的本质。
什么是循环工程,何时该用它?
循环工程是一种工作方式:不再每次输入提示词,而是设计一个循环,让 AI 按设定的间隔自行接手进行中的工作并持续处理。打造 Claude Code 的 Boris Cherny 也表示,自己如今不再每次敲提示词,而是挂上循环。关键在于把重复工作交给循环,而人则专注于设计与监控,以及拦住任何未经检查就对外发出的动作的护栏。
装修报价为何无法比较?又如何把它变成一个「可比较的市场」?
在规模达 22 万亿韩元的装修市场,价格竞争之所以失灵,是因为每家公司的实测方式和报价格式各不相同,让客观比较变得不可能。我和几位要好的伙伴决定用标准化和 AI 来破解这种信息不对称,核心是「把实测与报价分离」。检查员用移动 LiDAR 实测一次,就生成统一的项目体系;在此之上,经过验证的施工方只在单价和利润上竞争,消费者一次会面就能比较五份报价。
AX 为何是环境设计,而非培训?
AX 不是培训员工使用工具,而是设计员工与 AI 协作的整个环境。试图百分百跟上每周涌来的更新,只会让人精疲力竭。关键在于改变工作方式,让你能说出"以前做不到的,现在能做了",而起点是一个小实验:找出反复出现、令人厌烦的工作并将其自动化。
我为何亲手做了一个高尔夫开球时间比较工具,「感到不便的人自己动手解决」的时代又意味着什么?
为了订上一个周末的球局,我曾一个个翻遍十几个网站——于是我亲手做了一个工具,把韩国34家热门高尔夫球场的开球时间放在同一个屏幕上比较。我只挑出大型预订App不覆盖的非合作热门球场,实时汇集在一起;没有任何变现意图,如今我和朋友们都用它来实际订场。关键在于:一个时代已经到来——感到不便的人,可以用Vibe Coding亲手解决那份不便。
在一个人就能打造按月付费SaaS的时代,什么才是第一位的?
一台笔记本和一行AI:我们已进入一个人就能打造按月付费小型SaaS的时代。这是因为过去无法打造的服务,其投入成本已经崩塌,让从想法到上线的距离缩短到了几天。所以,首先需要的不是大资本或大团队,而是对日常小小不便的观察与执行。
AI 时代,哪种公司能活下来?
能活下来的公司,不是引入了 AI 的公司,而是把工作方式 100% 重做了一遍的公司。即便用同样的工具,工程师中 90% 用 AI 的组织和 100% 用 AI 的组织相差 10 倍。工具对所有人都一样,差距来自你在工具之上重新搭建了怎样的流程。
AX 的本质是什么 — 顾问离开之后仍在员工手中不断进化的系统
我在弟弟经营的贸易公司 Astros 验证的 AX 本质,不是让系统替人做事的结构,而是让员工用自然语言向 LLM 下达指令、并亲自核验结果的结构。结果是会计业务实现 60% 自动化,但更重要的变化在于:负责人的工作从简单录入转向分析与决策,而且即便顾问离开,系统仍在员工自己手中持续进化。
AX 的终点为什么是人,而不是系统 — SH Consulting 启程
在从广告与品牌战略出发的 22 年旅程中,我创立了 SaaS 公司,也经历了 Exit(退出),而走到这条路尽头时,我确认的结论出乎意料地简单。AX(AI Transformation)的终点不是系统,而是人。好的自动化替你把事做完然后离开,但好的 AX 会留下人——在顾问离场之后,仍能自己修改工具、主动发掘新自动化的人。
AX 该由谁来做才能成功?
AX(AI 转型)由每天做这项工作的一线员工亲手打造时,才会成功,而不是交给外部开发者。工作流里隐藏的例外和默契规则,只有每天执行的人才知道。因此 AX 教育的本质,不是增加开发者,而是让一线员工通过 Vibe Coding 自动化自己的工作。一位财务与经营管理人员把每天的发货下单工作自动化的案例,正说明了这一点。
为什么把自己的日常自动化是 AX 最好的起点?
把你每天重复的一件小事彻底拿掉——而不是部分优化——是 AX(AI 转型)最好的起点。原因在于:把一项任务完全从自己手里移走,而非让它快上几个百分点,才能让你亲身体会 AI 能替代什么、能信任到什么程度。一个个人例子:AI 从零散的 KakaoTalk 聊天中挑出日程,自动登记到日历,并在每天早上送来一份汇总简报。
决定 AI 编程生产力的是模型还是工作流?
AI 辅助编程的成果质量,更多由工作流而非模型选择决定。真正的瓶颈很少是模型不够强,而是规格模糊和工作未收尾。oh-my-claudecode(OMC)是在 Claude Code 之上把三个习惯固化为工具的编排层:deep-interview 厘清要做什么,ralplan 验证怎么做,ralph 保证真正做完。关键在于把"做什么、怎么做、做到底"变成被强制执行的流水线。
为什么应该让 AI 用 HTML 而不是 Markdown 输出结果?
对于已完成的成果物,用 HTML 取代 Markdown 来接收 AI 输出,能大幅提升理解速度。AI 生成文档的速度已经超过了人类阅读的速度,超过 100 行的 Markdown 实际上无人通读。Anthropic 的 Claude Code 工程师也提出"HTML 是新的 Markdown",开始以 HTML 接收输出;需要交互式画面时,Playground 插件可以补上这一环。标准很简单:需要看结构才能理解的完成品用 HTML,中间产物保留文本。
客服中心是成本部门,还是新业务的来源?
客服中心不只是成本部门,它可以成为挖掘新服务与新业务的来源。每天涌入的客户咨询本身就含有未满足需求的线索,用 STT 与 LLM 知识库把通话记录资产化,就能系统地挖出这些线索。剩下的关卡是个人信息脱敏,一旦解决,客服中心就会从成本部门变成业务挖掘引擎。
AI为什么输出的是概率而不是规则?
今天的AI不是执行人类编写规则的机器,而是一台基于自己从数据中找到的模式、输出"垃圾邮件概率93%"这类概率的机器。像转账这样条件明确的问题,基于规则的代码可以完美解决;但像图像识别这样例外众多、边界模糊的问题,规则就会崩溃。机器学习和深度学习正是从规则系统的这一失败中诞生的,而这一区分也成为AX咨询中拆解业务的第一标准。
什么是 AI 编排?从 RAG 聊天机器人止步之处开始的控制流设计
AI 编排是一种控制流设计:它不依赖“提问—检索—回答”的单线管道,而是设计出受阻时能折返的循环和依情况改变路径的分支,让 AI 能够处理复杂的真实业务。LangChain 负责标准组件,LangGraph 负责控制流,LangSmith 负责可观测性。对一次 API 调用就能完成的工作而言,这套工具是浪费;只有当业务复杂到需要循环和分支时,才值得拿出来用。
什么是后端?一部始于1993年留言板的问题解决谱系
后端是服务器接收请求、处理数据并返回结果的领域,它诞生于1993年解决留言板问题的过程中。预先做好的HTML文件无法把访客刚留下的留言展示给下一个人,于是服务器开始在每次请求到来时当场组装页面,这就是起点。此后三十年的发展史也是同一模式的重复,了解这套谱系之后,非开发者也能对AI下达关于后端的具体指令。
在氛围编程(vibe coding)中,AI为何总是推荐Supabase?
因为原本属于两条完全不同技术谱系的数据库与存储,各自突破自身的极限后汇流成了同一个平台,而Supabase正是这个交汇点。这个推荐不是口味问题,而是技术史的结果;一旦把这条谱系装进脑中当作地图,你选择用哪种工具、以及如何给AI下达指令,都会随之改变。
AI 把代码都写好的时代,为什么还需要前端知识
因为即便 AI 替你把代码写好,若不懂前端的基本概念,你能让 AI 做的事就到此为止。React、npm、构建、SSR 这些词不是需要背诵的术语,而是一条问题解决的连锁——每一个都是为了解决上一步所产生的新问题而诞生——只有当这张演化地图装进脑中,你给 AI 的指令才会变得具体。
LLM 究竟是如何运作的 —— 非开发者应当用代码亲眼确认的四件事
LLM 并不是会记住对话的存在,而是在每一轮都重新读取此前的全部对话、再预测下一个 token 的概率模型。这一运作方式表现为上下文窗口被填满、成本上升,韩语在 token 上的不利,幻觉,以及输出随 temperature 与系统提示词而变动。这些现象只有在你用几行代码亲手复现、在屏幕上亲眼看到时,而非仅仅听人讲解时,才会真正成为验证流程与对话历史管理之类的设计课题。
什么是部署——为什么 localhost 在朋友的电脑上打不开
部署是把只存在于自己电脑上的代码放到服务器上、让互联网上的任何人都能使用的过程。本文梳理了氛围编程(Vibe Coding)的成果为什么只能在 localhost:3000 上运行、部署如何从 FTP 进化到 Git、Docker 和 CI/CD,以及 Vercel 这类平台替你做了什么、代价又是什么。把这张地图装进脑子,向 AI 提的问题就会不一样,而提问的具体程度正是非开发者氛围编程水平的分水岭。
什么是 K Public Data MCP — 把韩国公共数据接入 AI 的服务器
K Public Data MCP 是一个开源 MCP(Model Context Protocol)服务器,把韩国法制处国家法令信息中心、DART 电子公示系统、公共数据门户等分散的公共数据 API 整合为一,让「搜索民法」「查三星电子财报」「找江南区的药店」在 AI 聊天窗口直接可用。只需注册一个连接器 URL,无需申请 API 密钥或安装程序。
什么是 Harness Engineering(智能体缰绳工程)
Harness Engineering 指的是:不改动 AI 模型本身,而是通过设计模型可使用的工具、必须遵守的规则与工作流,来提升产出质量的工程实践。同一个模型,缰绳(harness)设计不同,表现差异巨大——在升级更昂贵的模型之前,应当先检查这一层。
AX 项目为什么失败 — 别帮那个团队,把那块工作消灭掉
AX(AI Transformation)项目最常见的失败模式:成立 AX 团队,巡回各部门收集需求、按需求做工具——做好了,业务部门却不用。成功的 AX 的起点不是「帮帮那个团队」,而是「把那个团队的整块工作单元彻底消灭」;人不是裁掉,而是转向新岗位。
生成式 UI 与 MCP 应用 — 智能体时代的界面走向何方
智能体 UI 正沿三个阶段进化:静态(智能体往预制组件里填数据)、声明式(智能体写 JSON 描述,渲染引擎映射到设计系统)、生成式(模型在运行时即席生成 HTML/CSS)。当前的均衡点是声明式;迈向生成式的关键不是能力而是信任——即沙箱这一安全的分发结构。MCP 应用正作为该分发渠道受到关注。
AI Native 与 AI Assisted 的区别 — 你的公司属于哪一种
AI Native(AI 原生)是指几乎无需人工干预、整个工作流由 AI 完成的结构;AI Assisted(AI 辅助)是指人的工作保持原样、AI 在旁边帮忙处理一部分的结构。大多数企业的「AI 原生宣言」实际上停留在 AI 辅助阶段——分不清这一区别的公司,引入 AI 之后生产率依然原地踏步。
Claude怎样才能"看懂"一段视频并作答?
Claude本身无法直接播放视频,但接入开源工具/watch后,只需一个YouTube链接或本地录屏文件,就能把视频逐帧拆解、配上字幕,基于画面中实际出现的内容作答——而不是靠标题或说明文字猜测。