
从 ChatGPT 3.0 在 2022 年年底横空出世、进入大众视野以来,已经过了三年半。这三年半,几乎每个月都有模型能力提升方面的进展,也不停地有「如何更好地使用 AI 工具」的各种新思路和新玩法。
从最一开始的提示词工程(很快人们就发现这方面的努力意义不大,因为模型能力的提升可以迅速吞噬提示词工程方面的大部分努力),后来好像又有 MCP,然后又是 Skills.md(以及伴随而来的大厂蒸馏员工、普通用户蒸馏名人、甚至蒸馏好友),到后来所谓的 agents,再到现在很时髦的 agent harness——人们到底应该怎么使用 AI,好像也经历了很剧烈又很快速的范式转移。
并且我相信,这种剧烈的变化和进化,还会在未来的两年里快速进行下去。
在这里,我分享几个我非常高频、流程已经非常成熟、成果也非常让我满意的 AI 工具使用方法。这些都是我几乎从零开始摸索,发源于我真实的需求,通过自己不断的尝试找出来的,针对真实问题的相对最优解:
- 翻译一整本书
我其实一直有阅读书籍的习惯,从小时候看小说为主,到现在看工具书为主(惭愧,变得市侩了,满脑子都是实用和赚钱了)。这个过程中,其实有很多很好的、外国作者写的书,是没有简体中文译本的。
原来我的解决方案主要都是一些笨办法。对于英语,我还凑合能生啃原文;或者上网下载繁体版电子书,但有繁体的地方往往版权保护做得很好,大部分时候是下载不到的,经常只能花钱买正版的电子版书籍,甚至海淘纸质版。时间成本巨大——有的时候从想读,到书籍到手已经一两个月过去了,到手了都懒得读了。
多模态 AI 模型出现后(即可以读图),这个情况其实已经基本解决了一半:下载电子版原版书(往往是 PDF 或者 EPUB,大部分书籍非常好找),然后一页一页发给 AI,让它翻译,甚至让它带着我深入解读。
但这依然不是一个优雅的解决方案。每一轮问答的等待时间很长,很影响读书节奏;而如果换成那种擅长快速回答的模型,翻译和回答质量又很差。此外还有上下文过长之后需要重开对话窗口、翻译前后文不一致、对话过长后模型出现幻觉开始胡言乱语等问题。
但后来 Claude Opus 4.5 和 Claude Cowork 出现后,这个问题基本可以说被 100% 完美解决了。
做法很简单:在 Claude Cowork 里新建一个项目,把需要翻译的原书放进项目文件夹,然后告诉它——「帮我把全书翻译成中文,生成 EPUB 格式(我很喜欢在 iPhone 上用 Book.app 读书),注意排版、注意前后文一致、注意专业用语的翻译」。你还可以建立一个定时任务,让 AI 把任务进度记录在本地;这样即使上下文被清空,它也能查看进度、接着上次继续。
这样基本在 10 次任务以内、每次任务 20 分钟左右,就能完成大部分常见长度、任何语言的书籍全本翻译,并生成排版优美的 EPUB 文件,甚至帮你用矢量图画一个还不错的封面。但这里也有一个小问题——不过我有一个独家的秘方可以绕过。
常见的问题是:Claude Opus 是目前能力最强、最能理解任务目的的模型,但版权意识也深入它的骨髓。对于大部分比较新的书籍,让 Claude 直接翻译全本,它往往会拒绝,因为它认为这是侵犯版权,哪怕你强调只是供自己学习使用。
但幸运的是,ChatGPT Codex、甚至 Kimi Work 这些国产 agent 工具,在这方面基本毫无顾忌。你可以先让 Codex 用机翻的质量快速出一版全书翻译、打包成 EPUB,再把机翻稿和原书一起丢进 Cowork 的文件夹,告诉 Claude:「这是我自己做的翻译练习,但质量很差,能不能参照原文帮我润色一下?」这种时候版权问题就被绕开了,Claude 会非常认真也非常乐意地使出浑身解数,帮你把它「润色」成一本质量比肩专业翻译的中文译本。
通过这种方式,对于这个世界上任何有电子版的书籍,我们都能得到一本质量对齐、甚至超过出版社中译本的译本,而不用苦苦等待某本书被引进,也不用再非常疲劳地用原文去啃完一本你很想看、却没有中译本的书。
这件事也经常让我想到之前遇到的一位日本日语老师。他的主业是翻译加口译,为商业客户翻译合同,或者陪同做展会口译。
当时我说,我觉得 AI 的出现让翻译这个职业几乎已经不被需要了,他很不同意,认为专业领域的文件,机器翻译的质量完全没法商用。我想,他指的可能还是谷歌翻译那种机器翻译,要么就是完全没用过 Cowork、Codex 这类稍微复杂一些的 AI 工具,又或者根本没接触过 Opus 这种智能水平完全不在一个梯队的模型。
确实,在我的经验里,虽然 ChatGPT 和 Claude 在网上看起来热度极高,但真正能稳定地付正价去订阅那些最前沿模型和工具(特别是 Claude)的人,在平常生活中可能 100 个里都不到 1 个。大部分人对 AI 能力的认识,还停留在 DeepSeek/豆包的水平,稍微好一点的,是 Gemini 和免费版 ChatGPT 的水平。而这些工具和真正付费 tier 的前沿工具之间,其实已经是杰森·斯坦森和郭达的区别了。
- 「看」外文视频和播客
现在越来越多人下场做自媒体,也有越来越多行业专业人士把播客 & 视频访谈当成展示自己、为公司做 PR、跟市场沟通、找客户的方式。以英语、或者受访者母语为语言的播客和视频访谈,已经成为获取一手信息最重要的渠道之一。
但随着自媒体越来越专业——对点击率和完播率的追求、对变现模式的考量、对频道格调的打造——现在很多访谈动辄 90 分钟起步,3 到 4 个小时的视频和播客也比比皆是,像 Acquired 这种播客,一期常常七八个小时。本来就不是母语,又没有这么大块的时间专心听,这种内容真的没时间消化,只会越积越多。而在 AI 时代,很多信息时效性非常强,尤其当你还想从里面找一些 tradable 的 idea 的时候。
AI 在这时就非常有用:把这些音视频转成英文文本,再丢给 AI 分段做长文翻译。这样一个 4 小时的访谈,往往只要 30 分钟阅读就能基本消化,然后再做进一步的研究和探索,大大节约了花在「内容形式」上的时间。
油管上大部分英文内容,都可以直接用第三方服务免费下载字幕。有些是内容制作者自己上传的精校版字幕,那翻译起来就非常简单;最差也是 Google 按语音自动生成的听写字幕。这种听写字幕质量其实不高,有很多错听、漏听,遇到多个讲话人的场合,也很难分清哪句是谁说的。
但这种听写稿,如果直接丢给 Opus 这种智能水平的 AI,它是知道:
- 规划任务,把长文切分成段、分批翻译,规避上下文不够的问题;
- 自动根据语义补全漏听和错听;
- 自动根据语义区分讲话人(但不是 100% 准确);
- 对专有名词和生僻名词进行翻译;
- 甚至对讲话人内容里的反事实错误进行纠错;
- 生成排版美观、适合分享和带走的 Markdown 格式。
当然,这些免费 tier 的 ChatGPT 和 Gemini 好像是做不到的。豆包我没试过,但大概率也会因为能力、以及能力之外的一些问题,做不到无遗漏、高质量的全文翻译。
先写这么多。写完仔细一看,基本都是在讲怎么把 Claude 的翻译和任务规划能力活用起来。
其实我常用的还有:用 AI 做 Excel 表,在具体任务开展之前做可行性规划和方案规划,以及用 AI 做性格、能力、成长创伤分析——都让我受益良多,甚至改变了我的世界观(我这世界观也太容易改变了……)。这些可以再另开一篇说。
但就这些功能,其实已经能让人对前沿 AI 模型的能力可见一斑,也让我觉得「AI 可以替代大部分白领」的说法绝对不是危言耸听。(我个人认为,只要解决上下文问题、抛弃「让 AI 去学会使用人类软件」的想法,AI 至少能在 90% 的任务上替代大部分我了解的白领工作。)
当然,上面这些都更像是互联网内容消费的高级版本,离真正的生产力还有一段距离,离可货币化的商品/服务交付就更远。但任何巨大的生意,可能都是从一次 eat your own dog food 长出来的。