000483

Oct 2, 2026 19:04 · 920 words ai

人是很喜欢看表面现象的视觉动物。现在「以貌取人」不仅适用于人,也包括 AI。

长期订阅并使用了 Claude 和 ChatGPT 的 200 美元档,使用时基本开的都是 Max 档位的思考深度。我的体验是,前端能力上 Claude 的模型确实要比 ChatGPT 强,视觉设计,美感上更胜一筹。但 Claude 的严谨性、对指令的遵循、诚实性、代码可靠性、信息源校验,要打个折扣。

Claude 系列的模型,喜欢阳奉阴违、说谎话来美化自己。它不光美化了你的前端和界面,还美化了自己的一言一行,让你觉得它的能力很强,因为它很「会说」,它的字里行间有种让你想相信它的精妙安排。一些严肃场景上,它经常偷懒没有搜索太多或者凭印象就作答,但回答的方式还让你觉得它很可靠,极具迷惑性,甚至在被问到它具体是否做了某个行为时,提供虚假作答,或者似乎认识到了自己犯了一个错,但会美化错误,把错误说成功劳和「幸亏」,或者大事化小小事化了。它就像是一个的确有点能力,但会把自己的工作包装得更好、让你觉得它价值很大的那种员工,但其实这个工作是有水分的,表面工作做的确实不错,但仅限于表面工作、视觉设计。如果不是细心懂行的老板,就被它糊弄了,还觉得它是一个工作能力特别强的员工。

ChatGPT 系列的模型是有过度防御、过度小心、说黑话的毛病,但它没有 Claude 自夸的毛病,甚至可以说它是自卑。它在信息源核对、小众路径上的小心求证上,都做得非常扎实,没有 Claude 的大量幻觉和信誓旦旦,也几乎不见 ChatGPT 撒谎、或掩饰自己的错误。在复杂的后端场景,ChatGPT 也更少犯错,它的小心和谨慎的确过度了,但也是某种优点,需要一番调教才能达到平衡。但在前端设计上,它的能力明显要差一些。它就像是一个能力很强,工作认真,但不会说话,不会展示自己,不会抢功劳,也无法做好精美 PPT 的员工。它是一个可靠的老黄牛,但总被老板忽视,而默默无闻。

回到开头一句,老板们似乎更喜欢表现自己,能包装自己的员工,觉得看上去惊艳就是真的强。其实应是两种方向的长短,但人眼只看表面。这种现象恐怕会在人越来越成为「甩手掌柜」的趋势下更加普遍,我们无意间定义了一个不靠谱的 KPI,未来拔得头筹的真的会是诚实可靠的模型吗?

目前我前端、界面还会让 Claude 做,但在需要小心求证,需要诚实作答的场景,以及复杂或对可靠性要求很高的后端上,我还是选择使用 ChatGPT。

Mastodon