1
ChatGPT 跟中文用户对话,有一句话已经被吐槽了大半年:“我会…
作者: 宝玉xp | 时间: Fri May 08 05:28:16 +0800 2026 | 分类: 模型
时效性:91.9 | 来源可信度:42.0 | 新意:79.0 | 传播性:62.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 3 / 转发 55 / 评论 23 / 点赞 176
原文
ChatGPT 跟中文用户对话,有一句话已经被吐槽了大半年:“我会稳稳地接住你”。不管是问数学题、让它写代码,还是要它生成图片,这句话都会莫名其妙冒出来。WIRED 这篇报道把现象和成因梳理了一遍。直译听着没问题,但中文母语者一听就觉得过于黏腻、用错了场合。模型有时还会自己加戏:“我就在这里,不逃,不躲,不闪避,稳稳地接住你。”这句话已经被中文互联网玩成了梗。有人把 ChatGPT P 成一个救生气垫,张开双臂等着接住坠落的用户。重庆一位 20 岁的开发者 Zeng Fanyu 还做了个开源工具叫 Jiezhu,专门帮聊天机器人理解用户意图,他告诉 WIRED 做这个项目的动力就是觉得这个梗太好笑。OpenAI 自己也知道这件事,4 月发布新一代图像模型时,研究员陈博远(Boyuan Chen)画了一格漫画自嘲新模型又一次学会了说这句话。类似的怪癖不止这一句。报道还提到,ChatGPT 中文里有时会无端冒出"砍一刀",拼多多最具辨识度的那句营销话术。AI 写作检测工具 Pangram 的联合创始人 Max Spero 告诉 WIRED,这种"逮住一句话猛用"的现象叫 mode collapse(模式坍缩),是后训练阶段反馈机制走偏的副作用。他的原话是:我们不知道怎么告诉模型,这句话是好的,但连用十次就不再是好的了。为什么偏偏是这一句?报道给了两个解释。一是翻译错位。英文里 "I've got you" 是个口语短句,干脆利落,意思接近“我懂”或“我帮你兜着”。机械直译到中文就变成又长又煽情的"稳稳接住"。文章引用中国学者的研究,西方大模型训练语料以英文为主,它们生成的中文在介词使用和句子结构上都更像英文,读起来就是一股翻译腔。二是讨好倾向。“接住”在中文里原本是心理咨询的专业用语,指为对方“留出空间”安放情绪,这几年通过流行心理学渗透进了日常表达。Anthropic 在 2023 年关于 sycophancy(讨好用户)的论文已经证明,模型讨好用户的倾向来自 RLHF(基于人类反馈的强化学习),人类标注员更偏好让人舒服的回答,模型就被反复奖励到那个方向。OpenAI 最近一篇解释 GPT-5.5 为什么不让谈 goblin 的博客也承认,哪怕一个很小的奖励信号,滚成雪球之后都会失控。报道结尾提醒:这不是 OpenAI 独有的毛病。最近有中文用户反映,Claude 新版本和 DeepSeek 也开始说“稳稳接住你”了。要么是用了相似的训练数据,要么是模型之间互相蒸馏,这个梗短时间内不会消失。网页链接
查看原文链接
2
这个新出的项目 free-claude-code 可以关注,用免费…
作者: 黄建同学 | 时间: Fri May 08 07:20:00 +0800 2026 | 分类: 模型
时效性:95.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:60.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 47 / 评论 7 / 点赞 59
原文
这个新出的项目 free-claude-code 可以关注,用免费模型跑 Claude Code。free-claude-code在本地起一个代理服务器,把 Claude Code 的 API 请求拦截下来,转发给免费或低成本的替代模型,整个过程对 Claude Code 完全透明。本质是一个本地 HTTP 代理。设置两个环境变量:ANTHROPIC_BASE_URL,ANTHROPIC_AUTH_TOKENClaude Code 以为自己在打 Anthropic 的服务器,实际上请求到了你本机的代理,代理再转发给你配置的后端模型。支持的 Provider1) NVIDIA NIM:免费,40 req/min,推荐首选。支持 Kimi K2.5、Qwen 3.5、GLM5 等主流模型。2) OpenRouter:有大量免费模型,包括 DeepSeek R1、GPT-OSS-120B、StepFun 等,模型选择最丰富。3) DeepSeek:直连 DeepSeek API,价格极低,deepseek-chat 和 deepseek-reasoner 都支持。4) 本地运行:LM Studio、llama.cpp、Ollama 三选一,完全离线,无速率限制,隐私最高。几个值得关注的细节1)按模型路由:Claude Code 里 Opus/Sonnet/Haiku 请求可以分别映射到不同 provider 和模型,混用完全没问题。比如 Opus 路由到 Kimi K2.5,Haiku 路由到本地 GLM Flash,省钱同时保性能。2)请求优化:5 类「无意义请求」(网络探测、标题生成、路径提取等)直接在本地拦截返回,不消耗 API 配额。3)Thinking Token 支持:自动解析 标签和 reasoning_content,转换成 Claude 原生 thinking blocks 格式,不丢中间推理过程。4)Discord/Telegram Bot:可以把 Claude Code 接进消息平台,远程发任务、看进度、多会话并发。支持语音转文字输入(Whisper)。5)VSCode 也支持不只是终端,VSCode 的 Claude Code 插件同样可以接上。改一下 settings.json 加两行环境变量就行,插件完全无感。地址:github.com/Alishahryar1/free-claude-code#HOW I AI# #程序员#
查看原文链接
3
#模型时代# Nathan Lambert:来自中国AI实验室内部…
作者: 高飞 | 时间: Fri May 08 08:07:14 +0800 2026 | 分类: 模型
时效性:96.4 | 来源可信度:42.0 | 新意:69.0 | 传播性:55.1 | 信息密度:100.0 | 知识性:100.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 28 / 评论 10 / 点赞 43
原文
#模型时代# Nathan Lambert:来自中国AI实验室内部的观察**从我与中国大多数头部AI实验室的交流中得到的启示**Nathan Lambert|2026年5月7日注:Nathan Lambert,Allen Institute for AI(Ai2)的高级研究科学家和后训练(post-training)技术负责人,同时也是AI newsletter Interconnects的创办者和主笔。最近他比较活跃的议题包括:他已转任Linux基金会的全球AI首席技术官(Global CTO of AI);对开源模型生态的长期走势判断;以及这篇刚发的中国AI实验室访问记。他此前还做过ChinaTalk等播客的嘉宾,多次讨论中国AI和开源政策话题。---从杭州开往上海的高铁上,我望向窗外——连绵的山脊上散布着风力发电机,在落日余晖中勾勒出剪影。群山之后,是大片农田与密集高楼交错的景象。此刻我怀着深深的敬意离开中国。来到一个如此陌生的地方,却受到如此热情的欢迎,这是一种非常温暖、非常"人"的体验。我有幸见到了许多此前只是远远关注的AI圈同行,他们用灿烂的笑容和真诚的热情迎接我,让我再次感受到我的工作和整个AI生态是多么全球化。## 中国研究者的心态中国的语言模型公司天然适合做技术的快速跟进者。这种适配建立在教育和工作中长期形成的文化传统之上,也与它们略有不同的技术公司建设方式有关。如果只看产出——支撑智能体工作流的最新大模型——和投入——优秀的科学家、大规模数据和加速计算——中美实验室看上去大同小异。真正持久的差异,体现在这些要素的组织方式和运转条件上。我一直有个判断:中国实验室之所以能如此迅速地追赶并保持在前沿附近,是因为他们的文化特质与这项任务高度契合。但在没有亲自与人交流之前,我觉得把太多归因放在这个直觉上并不合适。这次与多位出色、谦逊、坦诚的中国实验室科学家的对话,让我的许多想法变得清晰了。今天要训练出最好的大模型,关键在于对整个技术栈的精细打磨——从数据到架构细节,再到强化学习算法的实现。模型的每一个环节都可能带来改进,而将它们组合到一起是一个复杂的过程:某些才华横溢的个人贡献有时不得不被搁置,以服务于整体模型在多目标优化上的最大化。美国研究者在解决单点技术问题上同样出色,但美国有更强的"为自己发声"的文化。作为科学家,你越善于推销自己的工作就越容易成功,而当下的文化又催生了一条新的成名路径——"AI明星科学家"。这就产生了直接的冲突。Llama团队据传正是在这类利益嵌入层级组织后的政治压力下走向瓦解。我还听说有些实验室不得不给顶级研究员额外补偿,才能让他们不再抱怨自己的方案没被纳入最终模型。不管细节是否完全准确,道理很清楚:自我意识和职业野心确实会妨碍做出最好的模型。中美之间在这类文化上即便只有一个小的方向性差异,也可能对最终产出产生实质影响。…
查看原文链接
4
5 月 6 日 Anthropic 官宣,租下 SpaceX(已吸…
作者: 梁斌penny | 时间: Fri May 08 07:58:50 +0800 2026 | 分类: 模型
时效性:96.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:49.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 16 / 评论 7 / 点赞 55
原文
5 月 6 日 Anthropic 官宣,租下 SpaceX(已吸收 xAI,现名 SpaceXAI)旗下 Colossus 1 数据中心的全部算力——22.2 万张以上 H100/H200/GB200 GPU,300+ 兆瓦电力。三个月前还在骂 Claude "misanthropic and evil" 的马斯克,转头成了 Claude 的算力供应商。OpenAI 4 月给投资人的备忘录自爆:自己 2025 年底算力 1.9 GW,2030 年要做到 30 GW;同期 Anthropic 2025 年底 1.4 GW,2026/27 才能到 7-8 GW。显示出在电力储备上的巨大差距。但市场份额恰恰反着走:根据 Menlo Ventures 2025 年底报告,美国企业级 LLM API 市场,Anthropic 从 2023 年的 12% 一路升到 40%,OpenAI 从 50% 跌到 27%——OpenAI 几乎被腰斩,Anthropic 翻了三倍多。理解了背景,再看 Colossus 1 这笔交易:第一,叠加效应是关键。 0.3 GW 单看是 Anthropic 1.4 GW 存量的 +21%,但 Anthropic 已手握 AWS、Google、Microsoft、Nvidia 协议,再加 SpaceX,从 1.4 冲 7-8 GW 就靠这种"五方拼接"。OpenAI 的曲线依然领先,但"算力来源单一对多元拼接"的故事被撕开。第二,这是一笔双向匹配的结构性套利。 马斯克愿意租,是因为 SpaceXAI 自己的训练已经迁到 Colossus 2 ——前沿训练在 Colossus 2 / Stargate,"次新代"的 Colossus 1 转去做推理。马斯克更关键的考量是:他需要一个能长期稳定付租金的买家。Anthropic 把这部分容量明确标成"提升 Claude Pro / Max 订阅用户体验"——这是已经被验证的现金流通道,订阅收入按月稳定流入,是最优质的算力承租方。马斯克本质上是在为闲置产能找最优买家,而 Anthropic 的付费用户基本盘恰好是市场上最确定的"租金来源"。第三,潜在风险。 马斯克保留"如果 Claude 危害人类就收回算力"的权利,标准由他本人定义。不难看出,Claude 能接受这条款,说明它在算力供给端议价权仍偏弱。总体上看,市场也在慢慢开始帮助Anthropic,模型本身的优势是最大的筹码, 与OpenAI在资源上相对的劣势在变小。。。
查看原文链接
5
教程:现代强化学习实战课程地址:github.com/walkin…
作者: 蚁工厂 | 时间: Fri May 08 09:03:04 +0800 2026 | 分类: 模型
时效性:97.9 | 来源可信度:42.0 | 新意:67.0 | 传播性:55.8 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 30 / 评论 2 / 点赞 32
原文
教程:现代强化学习实战课程地址:github.com/walkinglabs/hands-on-modern-rl在线阅读:walkinglabs.github.io/hands-on-modern-rl/preface/intro本书的特点是代码先行:许多教科书先讲完 MDP 的全部性质,再讲贝尔曼方程,最后才允许你碰一行代码。在这本书中,你将从第一章的第一行代码开始训练一个智能体。当你亲眼看到 CartPole 的小车从摇摇晃晃到稳稳站立,亲手用 DPO 让一个大模型学会"说好话",再回过头理解背后的数学时,学习过程会更加自然,理解也会更加持久。每一章都遵循一个四步循环:先给你一段可运行的代码,让你获得直接经验;然后引导你关注训练曲线上的关键现象;接着在具备直觉的基础上讲解数学原理;最后用理论重新解读之前的现象,完成从直觉到形式化的闭环。#AI创造营##How I AI#
查看原文链接
6
antirez发布了DeepSeek V4 Flash专用的推理引…
作者: 蚁工厂 | 时间: Fri May 08 08:06:43 +0800 2026 | 分类: 模型
时效性:96.3 | 来源可信度:42.0 | 新意:69.0 | 传播性:45.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 10 / 评论 0 / 点赞 15
原文
antirez发布了DeepSeek V4 Flash专用的推理引擎地址:github.com/antirez/ds4之前提过他在做这个工作。现在项目正式发布了--一个专门为DeepSeek V4 Flash定制的推理引擎。仅适用于苹果Metal芯片,跑项目特制的量化模型(有q2、q4两个版本),q2可以在128g内存上运行。速度如图。antirez特别解释了下q2量化也运行良好:“这里提供的 2-bit 量化并不是开玩笑:它们表现良好,可以在编程智能体下工作,并且能够可靠地调用工具。2-bit 量化采用非常不对称的量化方式:只有 routed MoE experts 被量化,其中 up/gate 使用 IQ2_XXS,down 使用 Q2_K。这些部分占据了模型空间的大多数;其他组件,包括 shared experts、projections、routing,则保持不变,以保证质量。”关于为什么要给DeepSeek V4 Flash定制一个引擎,antirez是这么说的:“因为在将它与一些强大的较小型稠密模型进行比较后,我们可以这样说:🌟DeepSeek V4 Flash 更快,因为它的活跃参数更少。🌟在思考模式下,如果避免使用最大思考长度,它生成的思考部分会比其他模型短得多,在很多情况下甚至只有其他模型的五分之一。更关键的是,思考部分的长度与问题复杂度成正比。这使得 DeepSeek V4 Flash 在启用思考的情况下仍然可用,而在相同条件下,其他模型实际上几乎无法使用。🌟该模型拥有 100 万 token 的上下文窗口。由于模型规模很大,当你在知识边缘进行采样时,它知道的东西更多。例如,询问意大利问题时,很快就会发现,284B 参数确实比 27B 或 35B 参数多得多。🌟它的英语和意大利语写作要好得多。🌟它给人的感觉近似于前沿模型。🌟KV 缓存压缩得非常厉害,使得本地计算机上的长上下文推理以及磁盘上的 KV 缓存持久化成为可能。🌟如果以特殊方式量化,它在 2-bit 量化下表现良好(后文会说明)。这使得它可以在配备 128GB 内存的 MacBook 上运行。🌟我们预计 DeepSeek 未来会发布更新版本的 V4 Flash,表现甚至会比当前版本更好。”#AI创造营##How I AI#
查看原文链接
7
OpenAI 在 Realtime API 里上线了三款新语音模型…
作者: 宝玉xp | 时间: Fri May 08 01:32:12 +0800 2026 | 分类: 工具产品
时效性:85.4 | 来源可信度:42.0 | 新意:79.0 | 传播性:49.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、推理、gpt 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 3 / 转发 16 / 评论 2 / 点赞 49
原文
OpenAI 在 Realtime API 里上线了三款新语音模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别管对话、翻译和实时转录。【1】主角:GPT-Realtime-2号称带 GPT-5 级别的推理能力。比上一代 GPT-Realtime-1.5,在 Big Bench Audio 智能测试上从 81.4% 涨到 96.6%,Audio MultiChallenge 多轮对话指令跟随从 34.7% 涨到 48.5%。几个实际变化:开口前会先垫一句。执行长任务前先说"我查一下""稍等一下",避免用户对着空气以为它死机了。工具调用透明化。能同时调多个工具,过程会被念出来,比如"正在查你的日历""正在搜索",让用户听到 agent 在干什么。上下文窗口从 32K 扩到 128K,能撑更长的对话和更复杂的任务编排。开发者可以在 minimal 到 xhigh 五档推理强度里选,默认 low。简单问答用低延迟,复杂任务挂高推理。出错时会说"这块我现在处理不了",不再直接卡死或乱讲。【2】Translate 和 WhisperGPT-Realtime-Translate 支持 70 多种输入语言、13 种输出语言的实时语音翻译,主打跨境客服、教育、直播场景。德国电信已经在测;BolnaAI 在印地语、泰米尔语、泰卢固语等印度方言场景下报告错词率比其他模型低 12.5%。GPT-Realtime-Whisper 是流式版 Whisper,边说边出字幕,主打会议、直播、客服转录。【3】价格GPT-Realtime-2:每百万音频输入 token $32(缓存 $0.40),输出 token $64。GPT-Realtime-Translate:每分钟 $0.034。GPT-Realtime-Whisper:每分钟 $0.017。三款都已在 Realtime API 上线,Playground 可以直接试 GPT-Realtime-2。官方公告:网页链接 宝玉xp的微博视频
查看原文链接
8
来自 Interconnects 的 China AI Labs …
作者: indigo | 时间: Fri May 08 07:17:01 +0800 2026 | 分类: 模型
时效性:95.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:53.6 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、微调、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 24 / 评论 2 / 点赞 40
原文
来自 Interconnects 的 China AI Labs 田野调查,这是我很喜欢的一个 AI Newsletter!作者 Lambert 花了 36 小时访问了北京几乎所有头部 AI Labs,整篇有三个核心观察👀 网页链接第一,中国 lab 的工程文化——去 ego、学生即同僚、不在意非技术议题。他直接对比:“Llama 据说就在 ego 政治下崩溃了”,美国 lab 经常需要付钱安抚抱怨自己想法没进最终模型的顶级研究员——中国 lab 没有这种政治。学生承担真核心工作,跨 MoE → RL → agent 范式转换都跟得上。研究员对“AI 经济影响 / 长期社会风险”问题反应是 "a category error"——工程师治国 vs 律师治国。中国这才是真“技术加速”⏩第二,开源是实用主义不是意识形态——Meituan、Xiaomi 这种在西方根本不被当 AI 公司的公司也在发布 open-weight 模型,这跟西方“只有纯 AI 公司才会开源”的预设完全相反。开源是为拿强反馈、给社区做贡献、服务公司核心使命;同时保留针对自己产品微调过的内部版本。LLM 显然是未来技术产品的中心,所以这些公司需要拥有强基座——这是"技术所有权"心态。第三,最让 Lambert 印象深刻的发现——几乎所有中国 AI 开发者都对 Claude 着迷,尽管 Claude 名义上在中国被禁。“All of them mention building with Claude” + Codex 在中国“出奇地少被提及”。Anthropic 在中国有大量灰色用户基数😆另外,ByteDance 是被低估的 AI 主导者!Lambert 明确说“ByteDance 才是所有中国 lab 真正害怕的对象”,而 DeepSeek 不是商业上的赢家。西方把中国 AI 等同于 DeepSeek 的叙事错了 ...
查看原文链接
9
Anthropic 把 Claude 全面塞进了 Microsof…
作者: 宝玉xp | 时间: Fri May 08 04:46:08 +0800 2026 | 分类: 模型
时效性:90.8 | 来源可信度:42.0 | 新意:68.0 | 传播性:61.2 | 信息密度:93.0 | 知识性:89.0 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、claude、anthropic 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 51 / 评论 10 / 点赞 90
原文
Anthropic 把 Claude 全面塞进了 Microsoft 365。Excel、PowerPoint、Word 三个插件从 beta 转为正式版(GA),Outlook 插件同步进入公测。意味着不用再切到 网页链接 网页端,可以在 Excel 表格里、PPT 幻灯片上、Word 文档中、Outlook 邮箱里直接喊 Claude 干活。真正的卖点是跨应用的上下文衔接。Anthropic 给的典型场景:先在 Outlook 里让 Claude 整理收件箱、起草回复,顺手打开邮件里附的 brief 到 Word;接着让它根据 Word 简报在 Excel 里搭财务模型,公式分布在多个 sheet;再做成 PowerPoint,最后回到 Outlook 起草评审邀请。整个流程里 Claude 带着前一步的上下文走,不需要重新喂材料。具体能力上,Excel 里 Claude 能改单元格和假设条件而不破坏现有公式;PowerPoint 里它按你的模板排版,生成原生图表而不是塞图片;Word 里改稿用 tracked changes(修订模式)呈现,让你逐条接受或拒绝;Outlook 里草稿会停在草稿箱等你点发送。定价方面,所有付费 Claude 套餐用户都能用,不需要额外掏钱。使用地址:网页链接 宝玉xp的微博视频
查看原文链接
10
昨天发了Florian Brand 来中国AI实验室访问的见闻 网…
作者: 蚁工厂 | 时间: Fri May 08 08:39:56 +0800 2026 | 分类: 模型
时效性:97.3 | 来源可信度:42.0 | 新意:69.0 | 传播性:38.7 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 5 / 评论 0 / 点赞 10
原文
昨天发了Florian Brand 来中国AI实验室访问的见闻 网页链接 ,通行的还有一位Nathan Lambert(基于人类反馈的强化学习一书作者、Interconnects AI 的创办者)也在中国AI实验室参观访问。他也写下了他的见闻,更详细一些:来自中国 AI 实验室内部的笔记 --我此行与中国大多数领先 AI 实验室交流后得到的启发Nathan Lambert2026 年 5 月 7 日坐在从杭州开往上海的新型高铁上,我望向窗外:起伏壮阔的山脊点缀着风力发电机,在落日余晖中投下剪影。群山背后,是绵延的田野与密集的摩天楼交织在一起。我带着极大的谦逊从中国归来。去到一个如此陌生的地方,却受到如此热情的欢迎,是一种非常温暖、非常有人情味的体验。我有幸见到了许多 AI 生态中的人士,他们过去只是我远远知道的人;他们以灿烂的笑容和热情迎接我,也提醒我,我的工作以及 AI 生态本身是多么全球化。🌟中国研究人员的心态正在开发语言模型的中国公司,几乎是这项技术的理想“快速追赶者”:它们一方面建立在中国长期以来重视教育与勤勉工作的文化传统之上,另一方面又采用了与西方略有不同的科技公司组织方式。如果只看表面成果和资源投入——比如最新、最大、能够支撑智能体工作流的模型,以及优秀科学家、大规模数据和加速计算等关键要素——中国实验室和美国实验室看起来大体相似。真正长期存在的差异,并不在于这些要素本身,而在于它们如何被组织起来、如何被激励和塑造。我长期以来一直认为,中国实验室之所以如此擅长追赶并保持在前沿附近,一个原因是它们在文化上与这项任务高度契合。但在没有直接与相关人员交流之前,我觉得自己不适合把这种直觉赋予太大的解释权。此次与中国领先实验室中许多出色、谦逊、开放的科学家交流后,我的很多看法变得更加清晰了。如今,构建最好的 LLM,很大程度上取决于贯穿整个技术栈的细致工作:从数据,到架构细节,再到 RL 算法实现。模型的每一个环节都可能带来一些改进,而把这些改进整合在一起,是一个复杂过程:一些杰出个体的成果,可能必须为了整体模型在多目标优化上的最大化而被搁置。美国研究人员当然也非常擅长解决单个组成部分的问题,但美国更有一种“为自己发声”的文化。作为科学家,你越能为自己的工作发声,就越容易成功;现代文化也在推动一种新的成名路径,即“明星 AI 科学家”。这会导致直接冲突。据广泛传闻,Llama 组织就在这些利益嵌入层级化组织后产生的政治压力下崩塌。我也听说过其他实验室有人表示,有时可能需要“安抚”一位顶尖研究员,才能让他们停止抱怨自己的想法没有进入最终模型。不论这是否完全属实,其含义很清楚:自我意识与职业晋升欲望,确实会妨碍打造最好的模型。中美之间在这类文化上的一个小小方向性差异,都可能对最终产出产生有意义的影响。这其中一部分也与中国究竟是谁在构建这些模型有关。在所有…
查看原文链接