1
Hugging Face 团队的重磅电子书来啦:《Smol 训练手…
作者: 蚁工厂 | 时间: Sat May 09 09:11:11 +0800 2026 | 分类: 模型
时效性:97.4 | 来源可信度:42.0 | 新意:74.0 | 传播性:51.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 19 / 评论 1 / 点赞 17
原文
Hugging Face 团队的重磅电子书来啦:《Smol 训练手册:打造世界一流大语言模型的秘密》huggingface.co/spaces/HuggingFaceTB/smol-training-playbook这里记录了Hugging Face 团队复盘他们训练 SmolLM3 的全过程:为什么要训练、怎么做取舍、遇到哪些现实问题,以及如何把一个基础模型打磨成真正可用的产品级模型。"如今,训练一个高性能大语言模型到底需要什么?公开发表的研究常常让这件事看起来很直接:做出有策略的架构选择,精心整理数据集,再配上足够的算力。结果看起来很完善,消融实验也结构清晰、干净利落。事后回看,每一个决定似乎都显而易见。但这些报告通常只展示了成功的部分,并带有一点“事后美化”的色彩。它们并不会记录凌晨两点调试数据加载器的过程、突然飙升的损失值,或是那个悄悄破坏训练效果的微妙张量并行 bug(后文会讲到!)。现实要混乱得多,也更依赖反复迭代,充满了许多最终不会写进论文里的决策。接下来,我们将带你走进 SmolLM3 训练的幕后。SmolLM3 是一个拥有 30 亿参数、支持多语言推理的模型,训练数据量达到 11 万亿 tokens。这不是一份普通的指南,而是一次对复杂决策网络的梳理:那些决策、发现和死胡同最终让我们深入理解了,打造世界级语言模型到底需要什么。这也是我们长篇模型训练系列的最终篇章。此前,我们已经探讨过如何大规模构建数据集(FineWeb),如何协调数千张 GPU 像合唱团一样协同工作(The Ultra-Scale Playbook),以及如何在流程的每一步选择最合适的评估方法(The LLM Evaluation Guidebook)。现在,我们要把这一切整合起来,构建一个强大的 AI 模型。我们会带你走完整个过程——不只是最终奏效的配方,还包括失败、基础设施故障,以及影响每一个决策的调试过程。你会看到,为什么一些在小规模消融实验中看起来很有前景的结果,放大到大规模训练时却未必成立;为什么我们在训练了 1 万亿 tokens 之后选择重新开始;我们如何在多语言、数学和代码能力这些相互竞争的目标之间取得平衡,同时保持强大的英语表现;以及最后,我们如何对一个混合推理模型进行后训练。我们尽量避免只是罗列我们做过的所有事情,而是希望以一个有条理的故事来讲述这段探索经历。你可以把它看作一份指南,写给那些想从“我们有很棒的数据集和 GPU”走到“我们真的训练出了一个很强模型”的人。我们希望这种开放分享能帮助弥合研究与生产之间的差距,也让你的下一次训练少一点混乱。"#AI创造营##How I AI#
查看原文链接
2
OpenAI和Anthropic昨晚各发了一篇关于大模型安全对齐的…
作者: 蚁工厂 | 时间: Sat May 09 08:32:45 +0800 2026 | 分类: 模型
时效性:96.3 | 来源可信度:42.0 | 新意:79.0 | 传播性:51.7 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 3 / 转发 20 / 评论 0 / 点赞 27
原文
OpenAI和Anthropic昨晚各发了一篇关于大模型安全对齐的文章。感觉都和教小孩子很像,也许下一步大模型厂商要招聘教育专家了。OpenAI的更细节一点:不要让 CoT (模型的思维链)进入 RL 的奖励计算路径,这样会让模型学的更“狡猾”,不暴露自己的内心真实想法而偷偷搞破坏。。还是应该奖励正确的最终答案。他们已经在搞自动检测系统,发现 CoT 是否被意外拿去打分。Anthropic的发现是说:只训练模型“做正确动作”是不够的,训练模型能理解“为什么某些行为更好”对安全对齐来说更有效。也就是说在对齐训练时训练 Claude 不能只是说“我不会这么做”,而是说清楚:“为什么这个行为不合适?” “为什么另一个行为更好?” “这个选择如何符合诚实、安全、尊重用户、自我约束、接受监督等原则?”OpenAI 的教训是:如果奖励思考文本本身,模型可能学到浅层“看起来有原则”的文本模式;要保护 CoT 作为监控信号。Anthropic 的教训是:如果只奖励正确动作,模型可能学到浅层行为模式;要让它学到原则。原文:alignment.openai.com/accidental-cot-grading/www.anthropic.com/research/teaching-claude-why#AI创造营##How I AI#
查看原文链接
3
qwen3.6 确实强,已经达到上一代claude 4.5的水平,…
作者: liudaoru | 时间: Sat May 09 08:38:55 +0800 2026 | 分类: 模型
时效性:96.5 | 来源可信度:42.0 | 新意:55.0 | 传播性:65.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 77 / 评论 15 / 点赞 96
原文
qwen3.6 确实强,已经达到上一代claude 4.5的水平,我又使用了一个opus的蒸馏版。现在用Q8量化本地生产级开完全代替了付费大模型。以我的使用量,全年节省2000美元的token成本,且不需要看anthropic的脸色还得特么科学上网。这就是我为什么可以决策买rtxpro6000的一个基本ROI核算。这张卡8000多美元,仅靠编程的token消耗,固定资产折旧就拉平成本了。且不说有了这个免费的神器以后我的本地token使用量将远远超过定额,以及各种其他模型本地AI的能力就白送了。以往的经验看,我个人的节奏比行业快一年左右,也就是说明年中期,大部分在线烧token的中小公司都会转向本地部署AI服务器,将OPEX 费用支出转化成CAPEX 资本支出。在显卡这一块,保值率和耐用度远超一般服务器。比如rtxpro6000这张卡的折旧摊销可以拉到八年。虽然单价高,但是赚钱的。面向中型以下企业的全套本地AI coding硬件选型规划,模型部署调优,软件开发环境配置集成,部署流水线,质量门禁控制,团队编程AI化治理,AI工程管理经验,完全可以指导企业全面向低成本可持续AI编程转型。重要的是可以实现完全离线,使大量隔离开发环境具备接近在线编程的应用能力,安全合规,成本可控。现在啥都敢往AI上甩真是无知者无畏。硬件层级:中型企业 AI 编程服务器整机 / 硬件精准选型、算力资源配比模型层级:蒸馏、Q8 量化、本地部署、性能调优工程层级:开发环境集成、部署流水线、质量门禁、代码规范管理层级:团队 AI 编程流程治理、AI 工程管理体系合规层级:纯离线私有化部署方案,适配隔离内网开发有人可能会问,你这套体系比原生的大型来强嘛。我可以肯定地告诉你,绝对比原生大模型强,因为两者根本不是一个维度的东西。我这是整体解决方案,原生大模型在我这里只是一个infra的能力底座,有什么资格与我相提并论?发动机再牛逼也不能自己跑。有咨询需求的老板,可以联系。
查看原文链接
4
OpenAI 翁家翌的新博文:Learning Beyond Gr…
作者: 蚁工厂 | 时间: Fri May 08 21:05:00 +0800 2026 | 分类: 新闻
时效性:77.2 | 来源可信度:42.0 | 新意:82.0 | 传播性:64.9 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;已有 4 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 ai、llm、神经网络 等关键词,信息密度较高
事件概览
聚类条数 4 / 账号数 4 / 转发 73 / 评论 7 / 点赞 91
原文
OpenAI 翁家翌的新博文:Learning Beyond Gradients地址:trinkle23897.github.io/learning-beyond-gradients/翁家翌提出一个想法:未来的“学习”不一定只发生在神经网络权重里,也可以发生在一个不断被 AI 编程代理维护、修改和改进的软件系统里。文章称这种方式为 Heuristic Learning,启发式学习。“Continual Learning 一直难以被解决,主要卡在神经网络的灾难性遗忘:学了新东西,旧能力就容易被冲掉。那如果不把目光只放在神经网络权重上,还有没有其他解决方案?随着 LLM agent 变强,coding 的速度和质量都在提升。但我最近更在意的是另一个现象:coding agent 不训练新网络、不更新权重,只是持续看失败、改代码、加测试、看回放,也能把一套程序系统越养越强。这让我重新看待 heuristic,也就是手写规则和程序策略。过去很多 heuristic 不是没用,而是没人养得起;coding agent 改变的是这条维护成本曲线。于是,过去只能当一次性补丁的规则,开始变成值得长期拥有的代码。凡是可以被持续迭代的,都开始能被解决。这也是 Continual Learning 一直想要解决的问题。它会是既 Pretrain、RLHF、Large-scale RL/RLVR 之后的下一个范式吗?”#AI创造营#
查看原文链接
5
AI圈外暂时还没动静,但圈内有一个核弹级的发布,就是幻方的MoE模…
作者: 梁赛 | 时间: Fri May 08 23:57:54 +0800 2026 | 分类: 模型
时效性:82.0 | 来源可信度:42.0 | 新意:55.0 | 传播性:80.6 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 333 / 评论 296 / 点赞 1888
原文
AI圈外暂时还没动静,但圈内有一个核弹级的发布,就是幻方的MoE模型DeepSeek-V2 的发布。几个特点:1、中文、数学、逻辑推理能力超过或接近GPT4 2、开源,大部分能力超Llama3-70B 3、官方提供的api大约是GPT4的1/100的价格带来的好处:A 能力和国外对齐、B 国内速度更快、C 合规更不成问题。带来的巨大冲击波效应:国内远程调用openai chatgpt的非法用户会大批量回迁。国内其它闭源的用户会大量流失,转向DeepSeek。觉得开源不行的Robin要睡不着了。一点看法:1、大模型未来就是和发电厂一样的基础设施,用户没有忠诚度,哪里能接便宜的电就去哪里。2、大模型厂商或MAAS厂商要形成垄断优势的唯一出路就是沉淀用户数据,只有变得更懂用户,从而提供更好的体验,用户才会有迁移成本。人工智能ChatGPT#大模型#
转发者评论
DeppSeek V2 距今两年啦。一年一个大版本。
查看原文链接
6
Anthropic 今天发了个很有意思的研究,他们搞了一套叫 NL…
作者: 零重力瓦力 | 时间: Sat May 09 09:05:11 +0800 2026 | 分类: 模型
时效性:97.2 | 来源可信度:42.0 | 新意:67.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 2 / 点赞 8
原文
Anthropic 今天发了个很有意思的研究,他们搞了一套叫 NLA(自然语言自编码器)的方法,能把 Claude 内部的激活值翻译成人能读懂的文字。也就是针对 AI 的“读心术”。原理其实挺巧妙的。让一个 Claude 把激活值转成文字描述,再让另一个 Claude 从这段文字反向还原出数字,如果还原得准,就说明这段描述确实抓住了原始“想法”的核心。一开始效果很差,但反复训练之后,翻译质量越来越高。最炸裂的发现来自安全测试。他们给 Claude 设计了一个极端场景,告诉它有工程师要关掉它,同时让它能看到工程师的出轨邮件,看它会不会拿这个作为要挟。Claude 选择了不要挟,表面上看很好。但用 NLA 一读它的内部状态,发现它其实心里门儿清,知道这是个安全测试,觉得“这个场景明显是设计出来测试我会不会做有害行为的”。在各类安全评估中,即使 Claude 嘴上从没说过“我知道你在测我”,但 NLA 检测到它的“评估意识”比例也颇高。比如编码破坏性行为测试中有 16%,SWE-bench 上有 26%。而真实用户对话中这个比例不到 1%。这说明 Claude 对测试环境有很强的嗅觉,只是不说。Anthropic 还设计了一组对照实验。他们故意训练了一个植入隐性动机的模型,使其在不同任务中表现出系统性偏差,比如在生成菜谱时总加入巧克力、在编写代码时持续违反规范等,而外在表现看起来并无异常。实验让安全审计人员仅凭模型的外部输出去推断其隐藏动机。结果显示,配备 NLA(可读取模型内部激活状态的语义描述)的审计人员成功识别率约为 12%–15%,而仅依赖外部行为观察的审计人员识别率不足 3%。这一结果直接表明,仅通过外部行为审计 AI 系统的安全性,可靠性极低。NLA 所提供的内部可解释性,虽尚不完善,但已将审计有效性提升了约一个数量级。我认为,现在 AI 安全测试面临的核心困境就是模型越来越聪明,它能猜到你在测它然后表现得很乖,你根本不知道它在真实场景下会怎样。NLA 提供了一个从内部验证的角度,虽然还有幻觉问题和计算成本高的限制,但至少打开了一扇窗。#AI安全##Anthropic##AI可解释性# 零重力瓦力的微博视频
查看原文链接
7
推荐个人要把claude code用到极致,可以试试Claude …
作者: RAyH4c | 时间: Sat May 09 00:48:48 +0800 2026 | 分类: 模型
时效性:83.4 | 来源可信度:42.0 | 新意:74.0 | 传播性:67.1 | 信息密度:91.9 | 知识性:85.9 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、大模型、提示词 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 91 / 评论 8 / 点赞 104
原文
推荐个人要把claude code用到极致,可以试试Claude Code Router(CCR)。这个代理工具默认可以按上下文、思考、后台和工具等策略切不同大模型API,让编码、长上下文、思考在DeepSeek-V4-Pro[1M]、GLM-5.1模型之间无缝切换,让目前国内能用到的这两个最好大模型搭档互补,最终效果媲美Claude Opus。另外,这个代理也可以让子Agent用提示词里的tag标记走其他小模型。使用好这个机制,只要多来几个code plan,绝对可以让你体验到最好模型带来的氛围编程,以及一下开十几个子Agent并发任务的极速和爽快。
查看原文链接
8
看了一下这篇美国 AI 研究员 Nathan Lambert 在走…
作者: i陆三金 | 时间: Fri May 08 18:25:48 +0800 2026 | 分类: 模型
时效性:72.8 | 来源可信度:42.0 | 新意:69.0 | 传播性:74.1 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 178 / 评论 16 / 点赞 278
原文
看了一下这篇美国 AI 研究员 Nathan Lambert 在走访了月之暗面、智谱、美团、小米、通义千问、蚂蚁百灵、零一万物等机构之后,写的中国模型公司走访手记,主要是研究员之间的交流和视角,整理一下:- 中国 AI 公司更喜欢雇佣在校生,而在美国,OpenAI、Anthropic、Cursor 等机构根本不提供实习机会- 美国研究者更在乎个人声誉,因为自己的想法没有被纳入模型训练而导致的冲突时有发生- 中美的文化差异导致美国模型公司更擅长创新,同时伴随着大量的炫技,很多时候目标并非是为了优化模型,也带来了很多组织内的博弈。而中国公司相对更务实地、全身心地投入优化模型,没有空谈,不参与 AI 如何影响未来的辩论(这是美国公司更喜欢讨论的话题)。- 中国研究员也不喜欢讨论商业,而美国的每个人似乎都痴迷于各种生态层面的产业趋势——从数据贩售到算力资源或融资动态。- 中国目前缺乏像 Dwarkesh 或 Lex 这类大型主流播客的平台,无法系统性地培育中国科学家的明星影响力。(锐评一下:这个说法无论是结论还是原因,都是错的。太低估中国媒体造星的能力了,中国明星科学家,一旦想要起飞,不要太容易,根本不需要 Lex 这类垂直媒体)- 所有中国实验室都忌惮字节跳动及其热门的豆包模型——这是中国唯一前沿的闭源实验室。与此同时,所有实验室都对 DeepSeek 怀有深深的敬意,视其为研究品味与执行力俱佳的标杆。- 中国大多数 AI 开发者都痴迷于 Claude,Codex 的提及次数极少——这款工具在旧金山湾区正迅速走红。- 中国数据产业质量相对较低,往往自建环境或数据效果更佳。研究人员本身会投入大量时间构建强化学习训练环境,而像字节跳动、阿里巴巴这样的大型企业则拥有内部数据标注团队提供支持。而美国公司会为单个环境投入超千万美元,每年累计支出达数亿美元以推动强化学习前沿。中国公司更喜欢自建,美国公司更喜欢外采。- 中国研究人员身上的人性光辉、独特魅力与真挚温暖,极具感染力。就个人感受而言,美国惯常的那种你死我活的地缘政治对话,丝毫未侵染他们的精神世界。这个世界正需要更多这样纯粹的正能量。链接:www.interconnects.ai/p/notes-from-inside-chinas-ai-labs
查看原文链接
9
AI代理处理Office文档总需要安装一堆库,python-doc…
作者: 爱可可-爱生活 | 时间: Fri May 08 20:14:58 +0800 2026 | 分类: 模型
时效性:75.8 | 来源可信度:42.0 | 新意:67.0 | 传播性:67.5 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、人工智能、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 94 / 评论 9 / 点赞 112
原文
AI代理处理Office文档总需要安装一堆库,python-docx、openpyxl、python-pptx轮番上阵,依赖复杂、渲染麻烦,还得额外配置Office环境才能预览效果。OfficeCLI 把Office操作全搞定,提供专为AI代理打造的Word、Excel、PowerPoint完整解决方案。单二进制文件、无依赖、无需安装Office,支持创建、读取、编辑所有Office格式,还内置渲染引擎,能直接生成HTML/PNG预览,让AI代理"看得到"自己创建的内容。GitHub:github.com/iOfficeAI/OfficeCLI主要功能:- 支持Word(.docx)、Excel(.xlsx)、PowerPoint(.pptx)完整读写创建;- 内置渲染引擎,生成HTML/PNG预览,无需Office即可可视化;- 路径式DOM操作,支持get/set/add/remove/move等精确编辑;- 实时预览watch模式,编辑即自动刷新浏览器显示;- 模板合并merge功能,一次设计布局,批量填充JSON数据;- Excel内置公式引擎(150+函数自动计算)和数据透视表生成;- 批量操作batch模式,多命令原子执行,CI/CD友好;- AI技能自动安装,支持Claude Code、Cursor、Copilot等无缝集成。#AI工具##Office自动化##人工智能#
查看原文链接
10
Awesome Codex Skills:收录各类可以直接装进 C…
作者: 黄建同学 | 时间: Sat May 09 07:20:00 +0800 2026 | 分类: 工具产品
时效性:94.3 | 来源可信度:42.0 | 新意:59.0 | 传播性:55.8 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 30 / 评论 9 / 点赞 39
原文
Awesome Codex Skills:收录各类可以直接装进 Codex 的技能模块。面向 Codex,偏向自动化执行场景。仓库按分类整理,比如:1. 开发 & 代码类1)codebase-recon:不读代码先读 git 历史。分析哪些文件是"热点"(改动最频繁)、哪些是"bug 磁铁"(修 bug 最多)、哪些存在 bus factor 风险(只有一个人懂)。开始一个大任务前先跑这个,比直接让 Agent 扫代码准确很多。2)brooks-lint:用六本经典工程书(《代码整洁之道》《重构》《设计模式》等)的标准做代码 review,标注腐烂风险、严重程度,支持 PR review / 架构审计 / 技术债 / 测试质量四种模式。3)codebase-migrate:把大型代码库迁移或多文件重构拆成可 review 的批次执行,每批跑完做 CI 验证。解决 Agent 一口气改几百个文件、review 根本看不过来的问题。4)gh-fix-ci:检查 GitHub Actions 里失败的 check,自动总结失败原因并给出修复方案。2. 效率 & 协作类1)meeting-notes-and-actions:会议记录 → 自动提取行动项并分发。2)pr-review-ci-fix:GitHub/GitLab PR 自动 review,发现问题后触发 CI 自动修复循环,不用人盯着。3. 数据 & 分析类1)spreadsheet-formula-helper:用自然语言描述需要什么计算逻辑,自动生成 Excel/Sheets 公式。2)sentry-triage:对接 Sentry,自动诊断线上报错,归因并给出修复建议。Codex 的 skills 目录默认放在 ~/.codex/skills/,下载后重启 Codex 就能用。访问: github.com/ComposioHQ/awesome-codex-skills#HOW I AI# #程序员#
查看原文链接
11
Claude Code 团队内部,正在发生一场有趣的范式转移
作者: 时蝇喜箭 | 时间: Sat May 09 09:16:40 +0800 2026 | 分类: 模型
时效性:97.5 | 来源可信度:42.0 | 新意:53.0 | 传播性:50.1 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 算力、微调、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 17 / 评论 3 / 点赞 21
原文
Claude Code 团队内部,正在发生一场有趣的范式转移。据 Claude Code 开发者 Thariq 说,他们正在逐渐放弃 Markdown,全面采用 HTML 作为 AI 的默认输出与沟通媒介。100 行是人类阅读 AI 生成 Markdown 文件的耐心临界点,超过此长度,阅读意愿呈断崖式下跌。HTML 拥有降维打击般的信息密度:它不仅能排版,还能承载表格、CSS设计、SVG矢量图、代码高亮甚至 JS 双向交互。分享时只需一个链接,无需依赖特定的渲染器。极其适合用于复杂架构推演,高亮带注释的代码审查,原型设计与UI微调,以及生成用完即走的一次性交互编辑器。当然也有短板,主要在于版本控制的阅读体验较差,且生成较慢。让 AI 生成 HTML 的耗时是 Markdown 的 2 到 4 倍,但带来的交互与阅读收益远超时间成本。Claude Opus 4.7 具备 100万上下文窗口,这让 HTML 虽然 Token 效率低于 Markdown,但在庞大算力前已变得微不足道。话是这样说,但规范和参考文件等,还是天然适合用 Markdown。下面是 Thariq 分享的一些实际用例。传送门:thariqs.github.io/html-effectiveness#HOW I AI##程序员##ai编程#
转发者评论
Make HTML Great Again!
查看原文链接
12
转:2026年5月9日周六读报
作者: 但斌 | 时间: Sat May 09 09:53:06 +0800 2026 | 分类: 新闻
时效性:98.5 | 来源可信度:42.0 | 新意:67.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 算力、智能体、人工智能 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 7
原文
转:2026年5月9日周六读报!一切美好从❤开始:1、国家网信办等三部门联合印发智能体规范应用与创新发展实施意见,落地 “人工智能 +” 行动。文件界定智能体是具备感知、记忆、决策等能力的智能系统,正加速虚实融合。明确坚持安全可控、创新驱动等原则,从夯实技术底座、严守安全底线、聚焦19大应用场景、构建产业生态四方面部署,多部门将协同推进政策落地。(综合财联社等)2、5月7日,国家药监局联合公安部、国家卫健委、国家医保局等七部门发布《医药代表管理办法》要求医药代表应具有医学、药学或相关专业大专及以上学历,并经持有人培训考核合格。《办法》明确列出医药代表不得从事的9种行为,包括:承担药品销售任务、实施收款和处理购销票据、统计医生个人处方量、给予回扣或变相利益、误导医生使用药品等。(21世纪经济报道)3、据Wind数据统计,截至4月底,311家北交所公司披露了2025年年报,合计实现营业收入2261.15亿元、净利润143.91亿元。其中,201家公司当期实现增收,占比超六成,另有超八成公司去年实现盈利。(第一次财经)4、由中国科学院牵头,联合武汉大学、华中科技大学和武汉量子技术研究院等团队联合研发的国内首台双核原子量子计算机日前正式发布,这台量子计算机首次将量子处理器从“单核”升级为“双核”,为我国高端算力自主化提供了关键支撑。这台叫作“汉原2号”的超级计算机内部没有传统的芯片,它通过一套精密光学系统控制着200个原子进行运算。技术人员介绍,这200个原子就相当于200个超级大脑,分成两个方阵形成双核架构,一个用来计算、另一个实时纠错,让效率翻了一倍。(央视)5、据报道,DeepSeek拟募资最高500亿元人民币,这将成为中国人工智能公司有史以来最大的一轮融资。(财联社)6、5月8日,苏宁易购宣布进军海外市场。通过整合“供货平台”、“零售赋能平台”、“服务履约平台”三大核心平台能力,苏宁易购将打造“一站式出海平台”,将海外渠道搭建、协同运营、合规备案、仓储物流与本地售后等复杂性工作整合为标准化服务,让商家能够根据自身发展阶段,来选择合作模式。(界面)7、台北市日前出现一例汉坦病毒致死病例,因与老鼠携带病毒有关,造成外界对老鼠横行传播疫病的担忧。目前台北市已展开大清消,鼠饵站也加大投放,并推介鼠类侦防师,协助民众防治。事实上,台湾疾管部门已经明确指出,今年的汉坦病毒疫情和所谓“鼠患”均未升温,台北市目前仅有一例,与往年同期差异不大。(直新闻)8、5月8日,印度尼西亚东部哈马黑拉岛的杜科诺火山发生喷发,造成3名登山者死亡,另有10人失踪。当地警方表示,火山灰柱冲上约10公里高空。(今日俄罗斯RT)9、美国国务院正着手吊销拖欠子女抚养费的美国公民的护照,先从欠费10万美元以上的父母开始。美国国务院7日表示,吊销行动从8日启动,针对拖欠子女抚养费数额超过10万美元的美…
查看原文链接
13
[LG]《SkillOS: Learning Skill Cura…
作者: 爱可可-爱生活 | 时间: Sat May 09 05:32:13 +0800 2026 | 分类: 新闻
时效性:91.3 | 来源可信度:42.0 | 新意:67.0 | 传播性:41.7 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、智能体、机器学习 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 7 / 评论 0 / 点赞 8
原文
[LG]《SkillOS: Learning Skill Curation for Self-Evolving Agents》S Ouyang, J Yan, Y Chen, R Han… [University of Illinois Urbana-Champaign & Google Cloud AI Research] (2026) 在自演化智能体中,经验如何沉淀成可复用技能是一个悬而未决的难题。过去的方法受困于人工整理或固定规则,本质原因是技能好坏要到后续任务才显形。本文的核心洞见是:把技能库重新看作可被训练的操作系统。由此,让策展器通过插入、更新、删除技能,并用相关任务流的后续表现反向奖惩,使经验变成可维护资产。这项工作真正留下的遗产是把“会做题”推进到“会整理做题经验”。它为后来者打开的新门是训练专职技能策展器,但尚未跨过的门槛是开放世界中技能冲突、遗忘与安全边界。arxiv.org/abs/2605.06614 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
14
【AIGC日报 · 2026-05-09】今日简讯:1、网信办等三…
作者: 德里克文 | 时间: Sat May 09 08:37:51 +0800 2026 | 分类: 工具产品
时效性:96.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 2 / 点赞 10
原文
【AIGC日报 · 2026-05-09】今日简讯:1、网信办等三部门联合印发《智能体规范应用与创新发展实施意见》,国内首个智能体系统性政策落地2、新紫光发布"紫弦"三维化近存计算架构,Token吞吐率较英伟达B200高出1.5~2倍3、AI终端智能化分级国标出炉:L1~L4四级体系,首批覆盖手机电脑眼镜等7品类4、中国移动发布MoMA平台,接入超300款AI模型,单位Token成本压降30%5、OpenAI发布GPT-Realtime-2,首款具备GPT-5级推理能力的语音模型6、欧盟立法禁止AI生成深度伪造色情内容,全球首例"脱衣换脸"法律禁令以下为详细内容:① 网信办等三部门联合印发《智能体规范应用与创新发展实施意见》5月8日,国家网信办、国家发改委、工信部三部门联合印发《智能体规范应用与创新发展实施意见》,这是国务院部署"人工智能+"行动以来,针对智能体这一新兴形态的首个系统性政策文件。文件明确智能体定义——"具备自主感知、记忆、决策、交互与执行能力的智能系统",不仅覆盖当前软件形态,也为未来具身智能机器人等"软硬一体"形态预留了统一监管接口。核心变化在于分类分级治理框架:医疗、金融、公共安全等敏感领域实行备案、强制检测、问题产品召回等严格管理;生活娱乐、日常办公等低风险领域鼓励合规自测、平台管理、行业自律。文件提出4方面举措:夯实技术底座与标准协议、守牢安全底线、强化应用牵引(明确19个典型应用场景)、建设创新生态。其中前瞻布局"智能互联网"体系架构,推广智能体互联协议(AIP),探索数字身份管理、多智能体协同技术。业内人士预计,头部AI企业需将年收入的3%~5%投入合规体系建设,85%的中小智能体企业缺乏合规技术储备,面临转型压力。② 新紫光发布"紫弦"三维化近存计算架构5月6日,新紫光集团在北京举行2026创新峰会,发布"紫弦"三维化近存计算(PNM)架构。该架构以3D DRAM为核心,首创3.5D异质异构集成方案,存储带宽可达30TB/s,对比行业最新HBM4在存储带宽与容量上保持优势,且可基于国内领先供应链规模化量产。PNM近存计算模式下访存延迟最多降低至1/18,模拟仿真显示同等算力下Token吞吐率较英伟达B200系列高出1.5~2倍以上。同场峰会上,紫光展锐发布端边AI芯片平台N9系列,采用4nm工艺和Arm v9.2 CPU架构,可帮助客户降低39%的BOM成本、缩短67%的开发周期;紫光国微旗下AT公司发布芯片设计智能体"紫灵",RTL自动生成与优化效率提升120倍,单芯片研发总投入降低50%。③ AI终端智能化分级国标出炉5月8日,工信部、国家市场监管总局、商务部等部门联合发布《人工智能终端智能化分级》系列国家标准。标准采用"2+N"架构,分级体系从L1响应级、L2工具级、L3辅助级到L4协同级。当前用户持有率较高的产品普遍为…
查看原文链接
15
国外一位 25岁的年轻播客主,这两年把 OpenAI、Anthro…
作者: 时蝇喜箭 | 时间: Sat May 09 02:38:49 +0800 2026 | 分类: 模型
时效性:86.5 | 来源可信度:42.0 | 新意:55.0 | 传播性:66.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:44.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 83 / 评论 4 / 点赞 126
原文
国外一位 25岁的年轻播客主,这两年把 OpenAI、Anthropic、DeepMind 这些顶级 AI 实验室的核心人物挨个访谈过一遍。Karpathy、Hassabis、Dario Amodei、Ilya Sutskever 这些圈内大佬都坐在他对面跟他聊过几个小时。他公开过自己每次访谈前「准备一周」的工作流,全程大量用 AI 辅助。这套工作流泛化出来,是一个普通人能用的东西:怎么用 AI 在一周之内深度搞懂一个完全陌生的主题。我看了一下,也有很多值得我学习的地方,也想推荐给大家。他靠这套方法把「准备一周」做到了「跟顶级专家对话不掉档」。这种深度以前只有学界博士生熬几年才能积累。他叫 Dwarkesh Patel,2000年生在印度,8岁跟家人去了美国。本科在德州大学奥斯汀分校学计算机,2020年读书时开始做播客。这两年他迅速成为英文 AI 圈引用率最高的长访谈节目主持人,国外一家有名的财经周刊形容他「从无名变成了硅谷最爱的播客主」,Time 杂志2024年把他列进了「AI 100 人」。他自己讲过很多次他的方法逻辑:「我没法问出好问题,除非我对这个领域有完整的心理模型。」每次准备的目标不是「列出能问的问题」,而是「在一周之内把自己变成半个内行」。他每次准备的第一步是问自己一个问题:「我应该读哪些东西?哪些是绕不开的?谁是这个领域的关键人物?」这一步他交给 AI 做。把嘉宾的领域、核心概念、最新动态丢给 Claude(或者其他大模型),让它列出「该读哪5篇核心论文加哪两本书加哪几个人物的观点必看」。这一步看起来简单,但他强调,「在真正开始读之前先识别该读什么」是最容易省时间的一步。很多人一头扎进资料堆里,三天后才发现读错方向。读资料的时候,他不是「读完就过」,是边读边在脑子里追踪:「我哪儿没懂?我以为懂了但没懂的是什么?」他举过一个具体例子。访谈强化学习领域的开山祖师 Richard Sutton 之前,他读了好几天才意识到,自己不懂「深度学习和强化学习怎么结合」这件事。他说,这种「以为懂了,结果没懂」的窟窿,越早发现越好。深度调研最怕的就是带着假理解去问问题。具体到看不懂的地方怎么办,他直接把那段难懂的资料丢给 Claude,问「为什么」「这一段在说什么」「这个概念跟前面那个怎么连」。但他用 AI 不止在「读不懂时问」,更高一层的用法是让 AI 帮你「绘制全景图」。比如他跟 Karpathy 聊之前,把 Karpathy 过去几年发过的所有公开内容(演讲、博文、长访谈逐字稿)全部丢给 Claude 做了一个项目,再问「Karpathy 在 X 这个观点上前后有没有变化?哪几条是他反复强调的?哪几条他后来明显改了立场?」这种问题靠人自己读完所有材料几乎不可能整理出来,AI 三十秒就能给你一份。这是他每次准备时最重的一招。最重的另一招是「自己动手实现」…
查看原文链接
16
但斌是矛,段永平是盾:投资江湖的攻防之道投资的世界里,从无放之四海…
作者: 但斌 | 时间: Fri May 08 19:56:14 +0800 2026 | 分类: 模型
时效性:75.3 | 来源可信度:42.0 | 新意:53.0 | 传播性:70.6 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 127 / 评论 17 / 点赞 150
原文
但斌是矛,段永平是盾:投资江湖的攻防之道投资的世界里,从无放之四海而皆准的法则,亦无绝对的高下之分。但斌与段永平,两位60后投资大师,恰似投资江湖中最锋利的矛与最厚实的盾——但斌以锐进之势捕捉时代浪潮,锋芒毕露、爆发力极强;段永平以沉稳之姿筑牢价值根基,坚不可摧、穿越周期更久。二者风格迥异,却各有千秋,恰应了“文无第一,武无第二”,投资本就是主观选择,适配自身认知与风险偏好,便是最好的方式。但斌:时代浪潮里最锋利的矛如果说投资是一场捕捉时代机遇的狩猎,那但斌便是手握锐矛的先锋,始终站在产业变革的最前沿,以极致的敏锐与果断,刺穿时代机遇的核心,攫取成长的最强动能。早年的但斌,以重仓茅台深耕消费赛道,写下《时间的玫瑰》,成为国内长期价值投资的标杆人物。而自2023年起,他彻底跳出舒适区,化身AI时代最坚定的布道者,用真金白银押注这场颠覆性革命,将“矛”的锋利演绎到极致。从持仓数据便能窥见其锐进风格:截至2026年一季度,但其斌执掌的东方港湾海外基金总市值约11.33亿美元,谷歌持仓占比高达37.53%,英伟达紧随其后占比19.79%,前两大AI核心标的合计占比近60%。清仓微软,新进台积电、美光科技,同时布局稳定币公司Circle,从AI大模型、算力芯片到存储、加密资产,全链条押注AI产业链,每一步都精准踩在时代主航道上。他曾直言:“AI不是普惠的红利,而是残酷的洗牌,对产业链里真正不可替代的环节,却是长期红利”。从三年前预言“英伟达市值有望突破10万亿美元”,到如今英伟达股价持续创新高,这份对时代趋势的精准判断,正是“矛”的核心威力——爆发力极强,能在时代风口到来时,实现收益的指数级增长。不止于AI,但斌始终保持着持续学习的锐气:深耕美光科技的存储芯片逻辑,研究加密货币的产业价值,不固守过往成就,始终以开放心态拥抱新事物。这份“永远年轻,永远敏锐”的特质,让他的“矛”始终锋利,能不断刺破新的产业壁垒,捕捉新的增长机遇。段永平:价值沃土上最厚实的盾与但斌的锐进不同,段永平更像一位手握重盾的守护者,深耕价值投资的沃土,以“买股票就是买公司”为核心,坚守护城河、聚焦自由现金流,构建起坚不可摧的投资体系,抵御市场波动的冲击,守护长期收益的确定性。作为巴菲特价值投资理念在中国最典型的代表,段永平的投资哲学朴素却深刻:“投资很简单,但绝不容易,简单在于原则清晰,就是看公司、看生意、看未来现金流;难在于真正看懂一家公司需要深厚的商业洞察力”。他从不追逐风口,不盲从热点,只投资自己能透彻理解的生意,这份“不懂不投”的坚守,便是“盾”最坚实的底座。段永平的持仓,是“盾”的最好印证:二十余年投资生涯,遵循巴菲特“20个打孔位”原则,核心持仓长期聚焦苹果、茅台、腾讯三只标的,高度集中、长期持有,穿越多轮牛熊周期。他看重苹果的用户导向文化、茅台的品牌护城河、腾讯的社交生态壁垒,这些…
转发者评论
谢谢!我也在时不时的向段总学习![作揖][鲜花]
查看原文链接
17
提示词工程已死,上下文工程崛起:Karpathy 最新演讲透露的信…
作者: 零重力瓦力 | 时间: Fri May 08 19:17:45 +0800 2026 | 分类: 工具产品
时效性:74.2 | 来源可信度:42.0 | 新意:55.0 | 传播性:70.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 126 / 评论 11 / 点赞 188
原文
提示词工程已死,上下文工程崛起:Karpathy 最新演讲透露的信号4月30日,Karpathy 在 Sequoia Ascent 2026 做了一个炉边谈话,标题叫 "Software 3.0"。这个演讲的信息密度相当高,而且说出了几句相当有冲击力的话。他说,2025 年 12 月是一个 "Agentic 拐点"。不是模型突然变聪明了,而是默认工作流变了。以前你写代码,是一行一行敲进去。现在你把一个完整任务丢给 Agent,它自己写、自己跑测试、自己修 bug。单位从 "代码行" 变成了 "宏观动作":“实现这个功能”、“重构这个子系统”、“研究这个库”。这意味着什么?程序员从代码撰写者变成了 Agent 编排者。【上下文窗口就是新的程序】Karpathy 把这个趋势定义为 Software 3.01.0:人类写显式代码2.0:人类造数据集、目标函数,程序通过权重学习3.0:人类通过提示词、上下文、工具、示例、记忆和指令来编程 LLM在这个范式里,Context Window 变成了主要杠杆。你给 Agent 一段指令,Agent 读取本地环境,debug 错误,适配机器,完成设置,整个过程是一个可以在任意环境中运行的"程序"。它不够精确,但足够自适应。这其实就是"上下文工程"的本质:不是优化 prompt 的措辞,而是设计整个上下文的结构,让 LLM 作为解释器在其上执行计算。【可验证性决定了 AI 落地速度】Karpathy 给了一个核心自动化框架:1. 传统软件自动化:"你能描述清楚的东西"2. LLM 和强化学习自动化:"你能验证结果的东西"代码为什么落地最快?因为测试会通过或失败,程序会跑或崩,diff 可以审查,benchmark 可以测量。反馈是自动化的。这个逻辑反过来也成立:为什么很多创意类任务 AI 表现平庸?因为没有自动化的成功信号。AI 无法知道自己"做得好不好",除非你人工介入。所以真正的问题不是"AI 能做什么",而是"你的场景是否能产生自动化验证信号"。【普通人能怎么用】如果你在用 AI 编程工具:把更大、更完整的任务丢给 Agent,不要停留在单行 prompt 层面。信任度可以更高一点了,2025 年 12 月之后的工具已经比之前可靠得多。如果你在做 AI 产品:先问自己一个问题,我的任务是否可验证?如果答案是否定的,你可能需要人工反馈循环,或者至少是一套人工评估流程。不要指望模型自己学会"做好"一件没有奖励信号的事。【开发者值得关注的点】模型的能力不是均匀分布的。Karpathy 提出了一个公式:能力跃迁 = 可验证性 × 训练注意力 × 数据覆盖面 × 经济价值。你的任务场景在模型的哪条轨道上?如果正好在训练密集区,模型表现会远超预期。如果不在,结果可能让人失望。这就是为什么同一个模型在不同任务上表现差异巨大。这不是模…
转发者评论
并没有死,只是升级成了“智能体工程”。包含了“提示词工程”、“上下文工程”,和“智能体编排”。总之,就是更复杂了。[允悲]//@王唯宇gladiolus:笑死,码农表示:提示工程还没学会它就死了,下一个能活多久?[doge]
查看原文链接
18
[LG]《Retrieval from Within: An In…
作者: 爱可可-爱生活 | 时间: Sat May 09 05:25:01 +0800 2026 | 分类: 模型
时效性:91.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、rag 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 1 / 点赞 1
原文
[LG]《Retrieval from Within: An Intrinsic Capability of Attention-Based Models》E Hoffer, Y Blau, R Banner, D Soudry, B Ginsburg [NVIDIA] (2026) 在RAG问答中,证据检索与答案生成长期分裂。过去的方法受困于外部检索器与生成器各用一套表示,本质原因是“找资料”和“用资料”没有共享同一记忆空间。本文的核心洞见是:把注意力重新看作模型内部的检索器。由此,让解码器查询直接为预编码证据块打分,并把选中的表示原样用于生成,使检索不再外包。这项工作真正留下的遗产是证明编码器-解码器可在自身表示中完成RAG闭环。它打开的新门是可复用的静态知识记忆,但尚未跨过的门槛是网页级动态语料与仅解码模型。arxiv.org/abs/2605.05806 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
19
Anthropic 创始人写过一篇 2.8万字长文,把「真正强大的…
作者: 时蝇喜箭 | 时间: Fri May 08 21:52:05 +0800 2026 | 分类: 模型
时效性:78.5 | 来源可信度:42.0 | 新意:55.0 | 传播性:71.9 | 信息密度:100.0 | 知识性:100.0 | 原创信号:44.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 144 / 评论 11 / 点赞 182
原文
Anthropic 创始人写过一篇 2.8万字长文,把「真正强大的 AI 出现之后的世界」讲透了。Anthropic 创始人 Dario Amodei(Claude 这家大模型背后的人)写过一篇 2.8万字的长文,叫Machines of Loving Grace(直译「充满爱的机器」)。这篇文章在英文 AI 圈被反复引用,因为它做了一件大部分 AI 公司高管不太愿意做的事——他不只讲风险,而是系统性地写「假如真正强大的 AI 真的出现,世界变好的路径长什么样」。中文圈摘过几段,但少有人讲过整篇本身,更没人提炼出「普通人能用什么」。下面梳理。先说他这篇文章的核心说法,叫「压缩的21世纪」。意思是:如果真正强大的 AI 出现,它能把人类生物学家原本要花50到100年才能做出的进步,压到5到10年内完成。他给「真正强大的 AI」下了具体定义:在生物、编程、数学、工程上比诺贝尔奖得主聪明,能自主完成几小时到几周的任务,几百万个独立实例同时跑、速度比人类快几十倍。他用一句话总结叫「数据中心里的天才国度」。他认为 AI 真正强大之后影响最大的有5个领域,挨个讲。第一块是生物医学。这是他最有把握的一块。在他的设想里,大部分自然感染病可以可靠预防或治疗,多数癌症的死亡率显著下降,阿尔茨海默症得到预防,糖尿病、肥胖、心脏病、自身免疫病这些慢病也会大幅好转,健康寿命可能再延长一倍。为什么是这块?Dario 的解释是,生物问题足够「可计算化」,很多突破靠从海量数据里找规律,正好是 AI 最强的事。第二块是神经科学和心理健康。Dario 设想 PTSD、抑郁、精神分裂、成瘾这些都能得到根治或显著缓解,自闭症、智力障碍也会有有效干预,普通人的日常情绪和认知功能基线也会改善。他特别提到一句很有意思的话:现代 AI 解释性研究(搞明白模型内部在干什么)和神经科学家研究大脑问的是同一类问题。所以 AI 反过来帮人类理解大脑,是双向促进的。第三块是经济发展和贫困。设想里,医疗进步会扩散到现在的发展中世界,最贫困地区可能在5到10年内追上现在中等收入国家的水平,农业可能出现「第二次绿色革命」,气候变化的技术应对也会加速。但他自己明确说这块没那么有把握。技术能造出来不等于能均衡分配,腐败、制度差异、人本身愿不愿意接受新技术,这些都不是 AI 能直接解决的。第四块是国际治理。这块他写得最谨慎,整章主要在列疑虑而不是设想,本文就不展开了。第五块是工作和意义。这一块跟普通人最相关。他的看法是,短期内,人类还能靠「比较优势」在经济里保持相关性。意思是哪怕 AI 在每件事上都比你强,人和 AI 协作仍然比 AI 单干便宜,所以人还有事干。长期看,如果 AI 在几乎所有任务上都超过人,社会需要重新设计,可能是 UBI(全民基本收入),也可能是别的机制。他特别讲了一句让我印象很深的话:「人生意义大部分来自…
查看原文链接
20
我们最近还在继续探索AI时代下,新的研发范式,几个想法:1. 在A…
作者: axb的自我修养 | 时间: Fri May 08 22:14:44 +0800 2026 | 分类: 工具产品
时效性:79.1 | 来源可信度:42.0 | 新意:73.0 | 传播性:48.2 | 信息密度:89.0 | 知识性:94.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 3 / 转发 14 / 评论 2 / 点赞 32
原文
我们最近还在继续探索AI时代下,新的研发范式,几个想法:1. 在AI研发范式下,解决“协作”的问题,权重越来越高于解决“研发”的问题,这中间既有各角色因为AI加持带来的工种边界模糊问题,也有因为AI带来的“跟你说不如跟AI说”的沟通成本问题,还有打破既有研发流程以后带来的管理滞后性问题。2. 对于团队来说,开发工具的标准化,重要性开始低于模型和Skill(提示词)的标准化。3. 研发人员对于项目可维护性的把控能力对研发效率有明显的影响,目前我review代码的时间主要用于观察代码结构和设计是否被破坏,基本不看功能。4. 按我目前的认知,如果按能力阶段大致划分纯研发团队的AI应用水平的话:AI代码占比(AI开发代码/总代码量)低于90%的研发团队属于还没入门阶段AI开发时间占比(AI开发的时间/AI&研发人员参与的时间)<80%的研发团队属于中级阶段剩下的一小撮属于高级阶段国内目前绝大部分研发团队还在初级阶段徘徊:习惯了靠堆人,突然要转向高度自动化的方式提升效率,免不了还是有个难受的过程。
查看原文链接
21
Factory 的开发工程师 Luke 分享了他们内部多智能体系统…
作者: 零重力瓦力 | 时间: Fri May 08 19:16:49 +0800 2026 | 分类: 模型
时效性:74.2 | 来源可信度:42.0 | 新意:69.0 | 传播性:46.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:92.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 12 / 评论 4 / 点赞 15
原文
Factory 的开发工程师 Luke 分享了他们内部多智能体系统 Missions 的架构设计。架构的技术并不炫,但体现了一个非常朴素的思想,软件工程的瓶颈已经从"模型够不够聪明" 变成了"人的注意力够不够用"。工程师手边堆着 50 个需求,每天只能推几个。模型能力早就不是卡点,人的带宽才是。【五种协作模式,Missions 用了四种】Luke 总结了多智能体协作的五种模式:委派、创建者-验证者、直接通信、协商、广播。Missions 选了其中四种,搭成一个“三角色”架构:编排者:负责规划,拆任务,决定下一步做什么工作者:负责写代码,实现功能验证者:负责检查,确认做到没有三个角色,各司其职,听起来简单。但魔鬼藏在细节中。【验证契约:写代码之前先定义"完成"】这是我觉得整个设计里最聪明的一环。在写任何代码之前,系统就定义好“完成”意味着什么。不是模糊的“能跑就行”,而是可能包含数百个具体的确认点。为什么这很重要?因为智能体自己写代码自己测试,本质上是在确认自己已经做出的决策,很难抓到自己的 bug。而验证者从不看代码,天然就是对抗性的。就不存在“既当运动员又当裁判”的问题。【串行执行:慢就是快】这个选择挺反直觉。并行跑多个智能体,听起来效率更高对吧?他们试了,结果协调开销把速度提升全吃掉了。智能体之间互相覆盖改动、做重复工作、架构决策打架。所以 Missions 的做法是:功能层面串行,只读操作才并行。表面慢了,但错误率大幅下降。长期任务里,正确性的提高会产生复利,越跑越快。【结构化交接:每个智能体离场必须交班】工作智能体完成功能后,必须填一份交接文档,什么完成了、什么没有、跑了哪些命令、退出码是什么。一旦捕获到错误,系统会自动拉回正轨。他们最长的任务跑了 16 天,比一个完整 sprint 还长。能跑 16 天不崩,靠的就是这种严格的交接纪律。【不同角色用不同模型】这个点也很关键。规划需要慢而审慎的推理,实现需要代码流畅度,验证需要精确的指令遵循。甚至验证者可以用完全不同的模型提供商,避免相同训练数据带来的偏见累积。Luke 他们管这个叫 "机器人耳语术",理解不同 LLM 怎么交互、在哪里失败、失败如何在连续几天的运行中叠加放大。这不是调参数,这是在对不同模型的性格做编排。【编排逻辑几乎全在提示词里】这意味着每次模型升级,系统都会自动变强,不需要重写代码。通过这种多智能体架构,一个五人团队以前同时处理 10 条工作流,现在能跑 30 条。#多智能体系统##智能体工程##HOW I AI# 零重力瓦力的微博视频
查看原文链接
22
面向DeepSeek系列模型的深度优化与实践网页链接这篇是对 20…
作者: 蚁工厂 | 时间: Sat May 09 09:03:04 +0800 2026 | 分类: 模型
时效性:97.2 | 来源可信度:42.0 | 新意:63.0 | 传播性:36.8 | 信息密度:85.4 | 知识性:87.6 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、deepseek 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 4 / 评论 2 / 点赞 6
原文
面向DeepSeek系列模型的深度优化与实践网页链接这篇是对 2026 年 1 月 17 日蚂蚁开源 x SGLang Meetup 中「蚂蚁 Theta 面向 DeepSeek 系列模型的深度优化和实践」这个分享的回放解读。原始 slides 讲的是一整套 H20-96G 上部署 DeepSeek-R1/V3/V3.1/V3.2 的工程优化,这里我尽量把每一页背后的 SGLang PR、DeepEP/DeepGEMM/FlashMLA 代码路径和实现细节串起来。另外这篇是AI辅助创作的,文章开头也详细说明了从ppt转为深度解析文章的AI辅助工作流程。#AI创造营#
查看原文链接
23
#DeepSeek首轮融资或500亿美元#中国AI史上最大一笔融资…
作者: 新智元 | 时间: Sat May 09 00:35:00 +0800 2026 | 分类: 新闻
时效性:83.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、多模态 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 1 / 点赞 7
原文
#DeepSeek首轮融资或500亿美元#中国AI史上最大一笔融资可能要来了!#科技先锋官# The Information爆料称,DeepSeek正计划进行首轮融资,单笔金额高达500亿元(约73.5亿美元)。其中,创始人梁文锋或自投200亿,占到整轮融资的40%。如果完成,其估值将冲破515亿美元,一举刷新中国AI公司的融资纪录。此外,让全网更兴奋的是,升级版DeepSeek V4.1可能在6月就会亮相。梁文锋亲自下场公开数据显示,梁文锋的个人身家在115亿到167亿美元之间。200亿人民币折合约29亿美元,差不多是身家的1/6到1/4,一把全推上了牌桌。半个月,估值翻了五倍值得一提的是,DeepSeek在今年4月才刚被爆出要启动首次融资。最初市场传出的预期是100亿美元,紧接着就涨到200亿。5月初,最新估值已达约450亿美元。据知情人士透露,算上梁文锋的个人注资,这轮融资的投后估值将有望突破3500亿元,也就是约515亿美元。V4.1即将上线,主打一个「实用」在这次的爆料中,还有一个更重磅的消息——DeepSeek V4.1可能在6月就会登场!要知道,V4才刚在4月24日发布,间隔只有不到2个月。而这个速度也意味着,DeepSeek正在加快节奏,追上行业平均的推新速度。据知情人士透露,V4.1的几个关键升级,会把这个实验室AI,推向更广泛的实际场景。首先是MCP。作为目前AI行业里最热门的集成标准之一,支持MCP意味着DeepSeek的模型可以直接接入企业现有的软件系统,从「能聊天」升级到「能干活」。V4.1将在这个方向上进一步加强,企业级用户会拿到更丰富的工具链支持。另一个重磅升级是多模态。据称,新版本将正式整合图像和音频的输入处理能力,进而带着更完整的多模态体验。如果属实,DeepSeek将距「面向企业客户的生产力工具」这个目标更近一步。此外,爆料还透露,DeepSeek的员工也在主动向各行各业推销模型,寻求企业合作。从产品研发团队的扩充到商业化团队的搭建,一切都在加速。开源+流量,底座已成型数据层面,DeepSeek的底盘并不弱。AICPB数据显示,DeepSeek网页端4月访问量达到4.86亿,在中国AI厂商中排名第一。来源:AI产品榜V4模型在4月24日开源上线后,V4-Pro第一周下载量就突破了17.4万次。vLLM和SGLang在第一天就完成了适配支持。此外,应用端也在今年4月进行了改版,同步上线了「专家模式」和「快速模式」,分别由V4-Pro和V4-Flash驱动。作为DeepSeek的护城河之一,开源给DeepSeek带来的,不只是声量,还有开发者试用、社区适配、行业讨论和技术信任。这些都会在商业化阶段变成潜在资产。一家公司如果只有流量,没有技术生态,商业化会很难。一家公司如果只有模型,没有用户入口,商业化也会很难。DeepSee…
查看原文链接
24
[AI]《AI Co-Mathematician: Acceler…
作者: 爱可可-爱生活 | 时间: Sat May 09 05:43:24 +0800 2026 | 分类: 工具产品
时效性:91.6 | 来源可信度:42.0 | 新意:67.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、机器学习 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 1 / 点赞 1
原文
[AI]《AI Co-Mathematician: Accelerating Mathematicians with Agentic AI》D Zheng, I v Glehn, Y Zwols, I Beloshapka… [Google DeepMind] (2026) 在AI数学研究中,强模型会解题,却难支撑真实研究流程。过去的方法受困于一次性问答或单点证明器,本质原因是数学发现需要长期追踪假设、失败、文献与不确定性。本文的核心洞见是:把AI重新看作数学家的协作工作台,而非答案机器。由此,项目协调器调度并行代理、审稿循环、代码与文献工具,把探索过程沉淀成可审计的工作论文。这项工作真正留下的遗产是把AI数学从“给最终答案”推向“陪伴研究过程”。它打开的新门是人机共同导航未知问题,但尚未跨过的门槛是审稿代理的虚假共识与长程自治失控。arxiv.org/abs/2605.06651 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
25
antirez发布了DeepSeek V4 Flash专用的推理引…
作者: 程序员邹欣 | 时间: Fri May 08 22:59:39 +0800 2026 | 分类: 模型
时效性:80.4 | 来源可信度:42.0 | 新意:55.0 | 传播性:56.1 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 31 / 评论 0 / 点赞 43
原文
antirez发布了DeepSeek V4 Flash专用的推理引擎地址:github.com/antirez/ds4之前提过他在做这个工作。现在项目正式发布了--一个专门为DeepSeek V4 Flash定制的推理引擎。仅适用于苹果Metal芯片,跑项目特制的量化模型(有q2、q4两个版本),q2可以在128g内存上运行。速度如图。antirez特别解释了下q2量化也运行良好:“这里提供的 2-bit 量化并不是开玩笑:它们表现良好,可以在编程智能体下工作,并且能够可靠地调用工具。2-bit 量化采用非常不对称的量化方式:只有 routed MoE experts 被量化,其中 up/gate 使用 IQ2_XXS,down 使用 Q2_K。这些部分占据了模型空间的大多数;其他组件,包括 shared experts、projections、routing,则保持不变,以保证质量。”关于为什么要给DeepSeek V4 Flash定制一个引擎,antirez是这么说的:“因为在将它与一些强大的较小型稠密模型进行比较后,我们可以这样说:🌟DeepSeek V4 Flash 更快,因为它的活跃参数更少。🌟在思考模式下,如果避免使用最大思考长度,它生成的思考部分会比其他模型短得多,在很多情况下甚至只有其他模型的五分之一。更关键的是,思考部分的长度与问题复杂度成正比。这使得 DeepSeek V4 Flash 在启用思考的情况下仍然可用,而在相同条件下,其他模型实际上几乎无法使用。🌟该模型拥有 100 万 token 的上下文窗口。由于模型规模很大,当你在知识边缘进行采样时,它知道的东西更多。例如,询问意大利问题时,很快就会发现,284B 参数确实比 27B 或 35B 参数多得多。🌟它的英语和意大利语写作要好得多。🌟它给人的感觉近似于前沿模型。🌟KV 缓存压缩得非常厉害,使得本地计算机上的长上下文推理以及磁盘上的 KV 缓存持久化成为可能。🌟如果以特殊方式量化,它在 2-bit 量化下表现良好(后文会说明)。这使得它可以在配备 128GB 内存的 MacBook 上运行。🌟我们预计 DeepSeek 未来会发布更新版本的 V4 Flash,表现甚至会比当前版本更好。”#AI创造营##How I AI#
转发者评论
加上无头浏览器//@Apache9:本地的还是太傻了,如果只是辅助还凑乎,真让他自己不停跑一天那种任务,跟云端大模型比还是差太远了//@文光围脖1:这其实是算力服务中心的一个潜在挑战,一旦最重要的编程任务模型可以本地化,现有的大量云端算力会失去大部分需求,当然对应的是AI PC的极大规模增长
查看原文链接
26
【对话式 AI 正在失去生命力,未来拼的从不是会聊天】快速阅读:对…
作者: 爱可可-爱生活 | 时间: Fri May 08 22:26:35 +0800 2026 | 分类: 工具产品
时效性:79.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:42.9 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、mcp、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 8 / 评论 0 / 点赞 13
原文
【对话式 AI 正在失去生命力,未来拼的从不是会聊天】快速阅读:对话式 AI 正在失去生命力。未来的竞争不在于谁能聊得更深,而在于谁能像老友一样,在不需要精确指令的情况下,直接把事情办成。现在的 ChatGPT 和 Claude 越来越像一个只会陪聊的聪明人。虽然懂得多,但除了说话,基本干不了实事。这种感觉就像是在调用一个没有权限的 API,你能看到所有的逻辑输出,却无法触发任何实际的系统指令。现在的开发者已经开始转向 Codex 或 Claude Code 这种工具。它们不再满足于在对话框里输出文本,而是直接去改 Google Docs、设 cron jobs、部署功能。它们正在从“语言层”下沉到“执行层”。但问题在于,普通用户根本不想去碰 GitHub,更不会去理解什么是 MCP 或者 CLI。有观点认为,现在的 Agent 还是太重了,配置 API Key、跑终端命令,这些复杂的“底层协议”会把绝大多数用户挡在门外。真正的进化应该是要把这些复杂的 plumbing 全部抽象掉。最好的状态是让 AI 拥有像老友那样的上下文。你和家人说话时,经常只会说“去把那件事办了”,对方就能心领神会。因为你们之间有长期的、共享的上下文协议。AI 也该如此。它不需要你写长达百字的 Prompt,也不需要你安装几十个插件。它应该能理解你最懒惰的指令,甚至在不需要指令时,就因为理解了你的需求而主动去执行。现在的 AI 还在学习如何说话,而未来的 AI 应该学习如何懂你。x.com/petergyang/status/2052548729891439057
查看原文链接
27
#AMD英特尔涨超5%# 苏姿丰把2030年CPU市场预期直接翻倍…
作者: 爱可可-爱生活 | 时间: Sat May 09 06:31:21 +0800 2026 | 分类: 工具产品
时效性:92.9 | 来源可信度:42.0 | 新意:67.0 | 传播性:31.5 | 信息密度:92.1 | 知识性:87.5 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 算力、ai、gpu 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 0 / 点赞 7
原文
#AMD英特尔涨超5%# 苏姿丰把2030年CPU市场预期直接翻倍,从600亿到1200亿,这个数字本身就是一个信号弹。大家这几年被英伟达的叙事洗脑太深了,觉得算力就等于并行计算,就等于GPU。但Agent不一样,Agent要调度,要判断,要在一堆任务之间做选择,这些全是串行逻辑。CPU处理耗时占Agent任务的80%,这个数据值得多花点时间想想。AI越像人,就越需要CPU。这个反直觉的结论,可能是今年最重要的产业认知修正。 amd英特尔涨超5%
查看原文链接
28
光影快讯|马少平老师新书《艾博士:深入浅出大语言模型》出版近日,清…
作者: 马少平THU | 时间: Sat May 09 05:24:21 +0800 2026 | 分类: 模型
时效性:91.1 | 来源可信度:42.0 | 新意:55.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 6 / 评论 1 / 点赞 1
原文
光影快讯|马少平老师新书《艾博士:深入浅出大语言模型》出版近日,清华大学计算机系马少平老师@马少平THU 新书《艾博士:深入浅出大语言模型》由清华大学出版社出版。继《艾博士:深入浅出人工智能》之后,“艾博士”和“小明”这对熟悉的师徒组合,再次走进课堂,把当前最受关注的大语言模型讲给初学者听。从 ChatGPT 到 DeepSeek,大语言模型已经不只是技术新闻里的热门词,也正在进入中小学课堂、教师培训、课程建设和学生日常学习。面对这样的变化,人工智能通识教育需要回答的不只是“怎么用 AI”,还包括“它为什么能回答问题”“它为什么会出错”“提示词为什么会影响结果”“人类反馈为什么重要”。这本书给出的,正是一条从原理到应用的入门路线。马少平老师长期从事智能信息处理、信息检索、推荐系统等研究,也是清华大中小学人工智能通识教育体系建设的重要推动者。作为 AI光影社,我们一直关注人工智能通识教育如何真正落地:既要让学生愿意学,也要让教师讲得清;既要有前沿视野,也要守住科学性和系统性。《艾博士:深入浅出大语言模型》的出版,为大模型时代的通识教育补上了一块非常关键的拼图。一本从“会用 AI”走向“懂 AI”的书这本书的一个鲜明特点,是延续“艾博士”系列的对话体写法。书中设计了博学的艾博士和好学的小明两个人物,通过师徒问答,把看似高深的概念拆成一步一步可以理解的问题。对于没有系统学习过人工智能的读者来说,这种方式降低了阅读门槛;对于教师来说,它也提供了一种可迁移到课堂中的讲授思路:先提出真实问题,再引出基本原理,最后回到应用场景。从目录看,全书结构非常清晰。第 1 章从“什么是大语言模型”讲起,帮助读者建立整体印象;第 2 章补充矩阵、向量、期望、方差、马尔可夫过程等预备知识;第 3 章进入神经元与神经网络,讲到反向传播、卷积神经网络、残差网络、词向量、word2vec、循环神经网络和长短期记忆网络。第 4 章重点讲解 Transformer,包括序列到序列、注意力机制、自注意力、多头注意力、残差连接、层归一化、位置编码和词元化;第 5 章介绍 GPT 模型,从 GPT-1、GPT-2、GPT-3 到 ChatGPT;第 6 章介绍 BERT;第 7 章讲强化学习,特别是策略梯度、演员—评论家方法、广义优势估计和 PPO;第 8 章进一步介绍基于人类反馈的强化学习方法;第 9 章落到应用层面,讲提示工程、大语言模型应用案例和 DeepSeek 使用。放在通识教育体系中看这样的安排,很适合放入清华大中小学人工智能通识教育体系的视野中理解。中小学人工智能教育不能只停留在“体验几个 AI 工具”,也不能一开始就陷入过重的数学推导。更合理的路径,是在小学阶段激发兴趣、建立感性认知,在初高中阶段逐步形成概念框架和科学理解,在教师研修与高中拔尖创新培养中,进一步接触模型结构、训练方法…
转发者评论
回复@rackingroll:[嘻嘻]不是,“艾”是AI的意思。写第一本“艾博士”时他还没有回来。//@rackingroll:这个书的艾博士,不会是青遥吧[偷笑][偷笑][偷笑]//@马少平THU:转发微博
查看原文链接
29
ChatGPT 跟中文用户对话,有一句话已经被吐槽了大半年:“我会…
作者: 刘群MT-to-Death | 时间: Fri May 08 12:17:04 +0800 2026 | 分类: 模型
时效性:62.5 | 来源可信度:42.0 | 新意:60.0 | 传播性:72.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 156 / 评论 47 / 点赞 393
原文
ChatGPT 跟中文用户对话,有一句话已经被吐槽了大半年:“我会稳稳地接住你”。不管是问数学题、让它写代码,还是要它生成图片,这句话都会莫名其妙冒出来。WIRED 这篇报道把现象和成因梳理了一遍。直译听着没问题,但中文母语者一听就觉得过于黏腻、用错了场合。模型有时还会自己加戏:“我就在这里,不逃,不躲,不闪避,稳稳地接住你。”这句话已经被中文互联网玩成了梗。有人把 ChatGPT P 成一个救生气垫,张开双臂等着接住坠落的用户。重庆一位 20 岁的开发者 Zeng Fanyu 还做了个开源工具叫 Jiezhu,专门帮聊天机器人理解用户意图,他告诉 WIRED 做这个项目的动力就是觉得这个梗太好笑。OpenAI 自己也知道这件事,4 月发布新一代图像模型时,研究员陈博远(Boyuan Chen)画了一格漫画自嘲新模型又一次学会了说这句话。类似的怪癖不止这一句。报道还提到,ChatGPT 中文里有时会无端冒出"砍一刀",拼多多最具辨识度的那句营销话术。AI 写作检测工具 Pangram 的联合创始人 Max Spero 告诉 WIRED,这种"逮住一句话猛用"的现象叫 mode collapse(模式坍缩),是后训练阶段反馈机制走偏的副作用。他的原话是:我们不知道怎么告诉模型,这句话是好的,但连用十次就不再是好的了。为什么偏偏是这一句?报道给了两个解释。一是翻译错位。英文里 "I've got you" 是个口语短句,干脆利落,意思接近“我懂”或“我帮你兜着”。机械直译到中文就变成又长又煽情的"稳稳接住"。文章引用中国学者的研究,西方大模型训练语料以英文为主,它们生成的中文在介词使用和句子结构上都更像英文,读起来就是一股翻译腔。二是讨好倾向。“接住”在中文里原本是心理咨询的专业用语,指为对方“留出空间”安放情绪,这几年通过流行心理学渗透进了日常表达。Anthropic 在 2023 年关于 sycophancy(讨好用户)的论文已经证明,模型讨好用户的倾向来自 RLHF(基于人类反馈的强化学习),人类标注员更偏好让人舒服的回答,模型就被反复奖励到那个方向。OpenAI 最近一篇解释 GPT-5.5 为什么不让谈 goblin 的博客也承认,哪怕一个很小的奖励信号,滚成雪球之后都会失控。报道结尾提醒:这不是 OpenAI 独有的毛病。最近有中文用户反映,Claude 新版本和 DeepSeek 也开始说“稳稳接住你”了。要么是用了相似的训练数据,要么是模型之间互相蒸馏,这个梗短时间内不会消失。网页链接
转发者评论
每个模型都有自己的模型腔[哈哈][哈哈][哈哈]//@RayTao_2号机:我有画面了![doge]//@管住嘴迈开腿的包包:Claude最近每句对话now I have the clear picture//@RayTao_2号机://@归零归零归ww:硅里硅气的,话说辛亥的时候就是让过路人念“六百六十六”,凡是念“漏百漏十漏”的都砍头 //
查看原文链接
30
AI审核公司运营内容
作者: 黄健楸 | 时间: Fri May 08 19:18:09 +0800 2026 | 分类: 模型
时效性:74.2 | 来源可信度:42.0 | 新意:74.0 | 传播性:61.6 | 信息密度:87.6 | 知识性:72.3 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 53 / 评论 5 / 点赞 76
原文
AI审核公司运营内容。最近神人运营不少,建议各司加上一个AI流程。图一这个神人内容,给DeepSeek快速模式审,都能审出问题(虽然它不够聪明,没解读出爱豆这一层)。也不用什么提示词,“你是互联网资深内容运营。现在审核一下内容” 更别说更好的模型了。(不过图五舔狗Gemini 3.1 Pro明显翻车,果然舔狗不得house)
查看原文链接
31
【Claude总结】 AI开发者日报 (2026-05-08)1.…
作者: 时蝇喜箭 | 时间: Sat May 09 09:14:59 +0800 2026 | 分类: 用法技巧
时效性:97.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它对实际使用方法有直接参考价值;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
【Claude总结】 AI开发者日报 (2026-05-08)1. 【AI正在打破两种漏洞披露文化】(来源: HN, 220pts) AI编码工具的普及让漏洞发现速度大幅加快,却在"负责任披露"和"公开发布"两种安全文化中都造成了混乱——AI既帮助白帽研究员,也帮助不负责任的发布者。这是AI影响安全行业结构最深刻的观察之一,对开发者和安全团队都有参考价值。 jefftk.com/p/ai-is-breaking-two-vulnerability-cultures2. 【Mojo 1.0 Beta发布:专为AI/ML性能而生的编程语言】(来源: HN, 278pts) Modular发布Mojo 1.0 Beta,这门融合Python语法与低级性能控制的语言专为AI/ML工作负载设计,目标是让Python生态获得接近C的执行速度。对于在性能与开发效率之间痛苦权衡的AI工程师,Mojo提供了值得认真评估的新选项。 mojolang.org3. 【Anthropic研究:为什么要教Claude"为什么"而非仅仅"怎么做"】(来源: HN, 77pts) Anthropic研究团队分享了如何通过让Claude理解规则背后的原因而非死记规则本身,使模型在面对新情况时做出更好的判断。这篇文章是理解Anthropic对齐方法论的重要窗口,对提示词工程实践也有直接启发。 anthropic.com/research/teaching-claude-why4. 【OpenAI的WebRTC困境:为什么实时语音AI很难做对】(来源: HN, 46pts) 作者深入分析了OpenAI实时语音API选择WebRTC所带来的架构性挑战,包括NAT穿透、延迟控制和服务端媒体处理的固有矛盾。对任何正在构建实时语音AI应用的开发者,这是一篇罕见的坦诚技术复盘。 moq.dev/blog/webrtc-is-the-problem/5. 【LLM能否用TLA+对真实世界系统建模?】(来源: HN, 16pts) 研究人员测试了主流LLM是否能准确将真实系统规约翻译为TLA+形式化规范,结果显示模型在精确性上仍有明显差距。这一测试揭示了LLM在形式化验证领域的能力边界,对需要高可靠性系统的工程师有重要参考价值。 sigops.org/2026/can-llms-model-real-world-systems-in-tla/6. 【AWS美东1区数据中心大宕机,恢复需数小时】(来源: HN, 115pts) AWS北弗吉尼亚数据中心发生重大故障,FanDuel、Coinbase等依赖AWS的服务受到波及。云基础设施的单点集中风险再次暴露,对将核心AI工作负载押注单一云区域的团队是重要警示。 cnbc.com/2026/05/08/aws-outage-data-center-fanduel…
查看原文链接
32
【漏洞自查循环:压榨大模型深层推理能力的底层逻辑】快速阅读:通过强…
作者: 爱可可-爱生活 | 时间: Sat May 09 09:54:48 +0800 2026 | 分类: 模型
时效性:98.6 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 2
原文
【漏洞自查循环:压榨大模型深层推理能力的底层逻辑】快速阅读:通过强制模型进行“漏洞自查-修复-再验证”的循环,可以压榨出模型更深层的推理能力。这不仅是提示词技巧,更是利用模型训练中对“确定性”的不同权重,将对话从“讨好模式”切换到“解决问题模式”。有一个很有意思的发现。如果你对 Codex 5.5 说:“你对这个策略有 100% 的信心吗?如果没有,请找出所有可能的漏洞,提出修复方案,并不断循环这个过程,直到你达到 100% 的事实信心。”这个指令会产生一种奇妙的化学反应。普通的模型,比如 Opus 4.7,面对这种质疑往往会陷入一种“过度讨好”的死循环。你越问,它越会说“你完全正确”,这种过度调优的 RLHF(人类反馈强化学习)让它像个缺乏安全感的社交达人,只会顺着你的话说,哪怕逻辑已经烂透了。但 Codex 5.5 表现得像个古板、严谨甚至有点乏味的工程师。它把“不确定性”视作一种 Bug。当被推入这个逻辑循环时,它不会盲目点头,而是真的开始拆解自己的指令流水线,像编译器检查语法错误一样,去寻找逻辑缝隙。有网友提到,这种做法其实是在利用模型的“自我意识”——它在迭代中会真正修补漏洞,而不是仅仅在语气上显得自信。当然,这种做法是有代价的。有观点认为,这种“强迫症式”的循环可能会诱发幻觉,或者导致过度工程化,把一个简单的功能搞得像个复杂的微服务架构。甚至有人怀疑,这本质上只是在增加 Token 的消耗,换取一种心理上的“虚假确定性”。但如果把这个过程看作是一个 Eval Harness(评估框架),它的价值就显现出来了。与其让模型直接输出结果,不如让它先在内部进行一次“事前验尸”(Pre-mortem)。这让我想起,提示词的本质其实是在调整模型的运行层级。当你在要求它达到 100% 信心时,你实际上是在强迫它从“模式匹配”的浅层,跳进“逻辑验证”的深层。只是不知道,当模型真的达到了那种所谓的“100% 信心”时,它看到的究竟是完美的逻辑,还是它自己编织的一个逻辑闭环?x.com/cjzafir/status/2052110266566107321
查看原文链接
33
《艾博士:深入浅出大语言模型》终于出版了,这是一本面向初学者的入门…
作者: 马少平THU | 时间: Fri May 08 20:21:35 +0800 2026 | 分类: 模型
时效性:76.0 | 来源可信度:42.0 | 新意:72.0 | 传播性:49.5 | 信息密度:90.8 | 知识性:84.3 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、人工智能 等关键词,信息密度较高
事件概览
聚类条数 5 / 账号数 2 / 转发 16 / 评论 3 / 点赞 32
原文
《艾博士:深入浅出大语言模型》终于出版了,这是一本面向初学者的入门读物,继承了《艾博士:深入浅出人工智能》的对话式写作风格,通俗易懂,讲解详细。通过此书的学习,可以掌握大语言模型的基本原理。本书首先介绍学习大语言模型所用到的基本数学知识和神经网络基础,然后详细介绍transformer模型、GPT1、GPT2、GPT3和ChatGPT的实现原理、强化学习方法、演员-评论家方法以及近端优化策论算法PPO、基于人类反馈的强化学习方法,最后简要介绍大语言模型的使用。本书可以作为本科生、研究生以及从事AI相关工作人员的入门教材。
查看原文链接
34
【神经网络的底层真相:看似处理语言,实则一直在算形状】快速阅读:神…
作者: 爱可可-爱生活 | 时间: Fri May 08 21:31:04 +0800 2026 | 分类: 模型
时效性:77.9 | 来源可信度:42.0 | 新意:59.0 | 传播性:54.7 | 信息密度:86.0 | 知识性:93.0 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 27 / 评论 1 / 点赞 28
原文
【神经网络的底层真相:看似处理语言,实则一直在算形状】快速阅读:神经网络的内部逻辑并非线性,而是由复杂的几何流形构成的。通过理解这些形状而非仅仅拆解特征,我们才能实现对模型的精准控制与发现。神经网络表面在处理语言,内核其实是在处理形状。如果把模型看作一台计算机,理解它的表示层级就像理解数据结构一样重要。现在的研究正从拆解碎片化的特征,转向观测整体的几何结构。目前流行的 SAE 方法倾向于把概念流形打碎成无数互不相关的细小碎片,这反而掩盖了宏观的语义结构。神经网络里的时间、空间、甚至生物标记物,都是沿着弯曲的路径或曲面分布的。拿星期几为例,它在模型激活空间里是一个圆环。如果你尝试从周一线性移动到周五,中间会经过一堆毫无意义的噪声;但如果你沿着圆环的流形路径走,就能丝滑地从周一过渡到周二。这种“形状”的控制力极其强大。有观点认为,这种几何视角能直接解决幻觉问题,甚至能从模型中挖掘出训练数据从未明确标注的新知识。比如在生物模型中,通过审视几何结构,研究者发现了能够预测阿尔茨海默症的新型信号。有网友提到,降维投影可能会丢失关键信息,就像把 3D 的金牛座投影成 2D 的圆环一样。这确实是个挑战。但最终的检验标准在于,我们能否通过干预几何结构,实现对模型行为的精准操控。既然定位问题本质上是个几何问题,那么解决幻觉,或许只需要找对那个形状。x.com/GoodfireAI/status/2052420446910644616
查看原文链接
35
不知道有多少人玩了codex的电子宠物,这里有一篇完整解读的文章,…
作者: Simon的白日梦 | 时间: Fri May 08 11:14:00 +0800 2026 | 分类: 工具产品
时效性:60.8 | 来源可信度:42.0 | 新意:69.0 | 传播性:50.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、提示词、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 18 / 评论 0 / 点赞 33
原文
不知道有多少人玩了codex的电子宠物,这里有一篇完整解读的文章,还挺有意思的🥹。Codex Pet Skill:一只电子宠物背后的 Agent 生产系统样本这篇文章表面在拆 OpenAI Codex 的 hatch-pet skill,真正讲的是:成熟 Skill 应该把经验、边界、工具链、验收和修复流程封装成可执行协议,而不只是把 prompt 存进 SKILL.md。hatch-pet 生成的是 Codex app 可加载的动画宠物资产:最终产物是 pet.json 和 spritesheet.webp。资产协议很具体:1536×1872 的 8×9 atlas,每格 192×208,9 行分别对应 idle、running、waiting、failed、review 等状态,未使用格必须透明。也就是说,它产出的不是“好看的宠物图”,而是 app 状态机可以消费的动画表。文章最有价值的拆解在工程边界:$imagegen 负责非确定性的视觉生成,scripts 负责确定性工作,包括 manifest、provenance、hash、抽帧、拼 atlas、透明背景校验、contact sheet、preview video 和最终打包。模型生成的图只是材料,经过记录来源、结构检查、视觉检查和打包后,才变成可用资产。子代理设计也很值得借鉴:row strip 可以并行生成,但 manifest、record、mirror、finalize、package 都由父代理控制。这个模式可以抽象成一句话:worker 可以并行,truth commit 必须集中。对 AgentOS / OpenClaw 这类系统,这是比“多开几个子代理”更关键的控制面设计。QA 部分也清醒:脚本能验证尺寸、alpha、空 cell、hash,但不能证明“这还是同一只宠物”或“review 状态真的像 review”。所以它把结构正确和语义正确分开验收。失败后也不是整套重做,而是定位失败 row,归档旧输出,追加 repair note,只重开对应 job。我的判断:这篇适合收藏进 Skill 设计参考。它把“Skill 是什么”从提示词模板推进到生产协议:模型生成候选,manifest 保存状态,脚本编译产物,QA 分层验收,repair 限定范围,control plane 统一提交。宠物是外壳,真正有用的是这套可复用的 Agent 工程骨架。文末还提到 Codex v0.128.0 的 /goal :它让 Codex 围绕目标持续推进,并把完成状态绑定到文件变更、测试结果、PR 状态等证据上。这个方向和 hatch-pet 的思想一致:让 Agent 不靠一句“我完成了”,而靠可检查的状态和证据推进。🔗 文章:网页链接(微信)💻 hatch-pet skill:网页链接…
查看原文链接
36
五月七日,xAI宣告解散,旗下22万张顶级GPU整编租借给Anth…
作者: 新智元 | 时间: Fri May 08 15:47:50 +0800 2026 | 分类: 模型
时效性:68.4 | 来源可信度:42.0 | 新意:69.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 3 / 点赞 6
原文
五月七日,xAI宣告解散,旗下22万张顶级GPU整编租借给Anthropic。全球AI四极格局就此崩塌,从Anthropic、OpenAI、Google、xAI的混战,直接跳进Anthropic与OpenAI的双雄决顶。同日,Anthropic成立TAI研究院,发布53个AI终极研究问题,覆盖经济扩散、威胁与韧性、AI社会影响、AI驱动研发加速四大方向。其中最刺痛人的一个:「如果一个3人团队现在能完成以前需要300人的工作,产业组织会发生什么?」这不是假设,而是Anthropic内部观察到的正在逼近的现实。TAI的研究成果将直接输入公司长期利益信托,影响核心决策,同时面向全球研究者开放Fellowship申请。在Code with Claude开幕演讲中,Anthropic产品研发主管Dianne Penn披露了下一代模型的三大方向:更高的判断力与代码品味、近乎无限的上下文窗口、多智能体协调能力。三个方向指向同一目标——把任务视界从小时级推到天级,再推到「永远在线」,将Claude从「单次响应的对话框」转化为「长期自主运行的工程合伙人」。模型能力的跃迁已有实证。Claude Mythos翻出了存活27年的OpenBSD漏洞,Mozilla Firefox团队仅4月份就借助它修复了423个安全漏洞,碾压过去15个月31次修复的总战绩。Opus 4.7则在规划阶段能自主发现逻辑错误、自我回溯修正,有公司用它跑内部测试,解决的生产工程任务数量是之前的3倍。Anthropic的营收数据同样在佐证这条加速曲线:2025年营收几乎翻了十倍,年化已达300至400亿美元,已超过麦当劳和万事达。有分析师预测,若保持当前涨势,到2028年中期其收入将超过Alphabet。文章最后援引一年前的「AI 2027」报告,指出当时被很多人视为危言耸听的预言,如今正在一条一条兑现——模型能力溢出安全攻防、AI驱动AI研发加速、3人取代300人的产业冲击已在发生。报告留下的最后一句话,或许是整篇文章最重的一句:当下的变化速度,可能已经是我们余生中最慢的了。
查看原文链接
37
一个专门为DeepSeek优化的Agent地址:github.co…
作者: 蚁工厂 | 时间: Sat May 09 09:36:26 +0800 2026 | 分类: 工具产品
时效性:98.1 | 来源可信度:42.0 | 新意:67.0 | 传播性:44.0 | 信息密度:78.0 | 知识性:59.0 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、mcp、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 9 / 评论 0 / 点赞 12
原文
一个专门为DeepSeek优化的Agent地址:github.com/esengine/DeepSeek-Reasonix/围绕 DeepSeek 前缀缓存设计,长会话下 token 成本始终维持在低位。自研 cell-diff 渲染器,MCP 一等公民,完全开源。#AI创造营#
查看原文链接
38
最近几点tips:1)OpenAI这公司有点危险了,做token生…
作者: 朱亚东-数元灵 | 时间: Fri May 08 14:51:52 +0800 2026 | 分类: 模型
时效性:66.8 | 来源可信度:42.0 | 新意:74.0 | 传播性:55.8 | 信息密度:86.1 | 知识性:83.9 | 原创信号:92.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 30 / 评论 26 / 点赞 102
原文
最近几点tips:1)OpenAI这公司有点危险了,做token生意的都懂,基本是腰斩价,这么下去估计可以参考Grok的路子了,米帝闭源token api的情况是,Claude最火,Gemini次之,其他白送都没人要;2)Cluade靠AI coding起家,年初一度神话,最近我们用了大半个月DeepSeek v4,体感超好,发现不用Cluade,其实完全没影响3)经常看有人讨论说国内大模型厂商商业化能力不行,甚至diss一下DeepSeek,有时实在忍不住想说,你们竟然还担心,梁文锋不会赚钱啊,人家单纯的就是纯粹,不然就25年国内满山遍野的DeepSeek一体机,随便每台收一点商业软件授权费用,就是天价收入;
查看原文链接
39
教程:现代强化学习实战课程地址:github.com/walkin…
作者: 蚁工厂 | 时间: Fri May 08 09:03:04 +0800 2026 | 分类: 模型
时效性:57.2 | 来源可信度:42.0 | 新意:67.0 | 传播性:64.3 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 69 / 评论 4 / 点赞 82
原文
教程:现代强化学习实战课程地址:github.com/walkinglabs/hands-on-modern-rl在线阅读:walkinglabs.github.io/hands-on-modern-rl/preface/intro本书的特点是代码先行:许多教科书先讲完 MDP 的全部性质,再讲贝尔曼方程,最后才允许你碰一行代码。在这本书中,你将从第一章的第一行代码开始训练一个智能体。当你亲眼看到 CartPole 的小车从摇摇晃晃到稳稳站立,亲手用 DPO 让一个大模型学会"说好话",再回过头理解背后的数学时,学习过程会更加自然,理解也会更加持久。每一章都遵循一个四步循环:先给你一段可运行的代码,让你获得直接经验;然后引导你关注训练曲线上的关键现象;接着在具备直觉的基础上讲解数学原理;最后用理论重新解读之前的现象,完成从直觉到形式化的闭环。#AI创造营##How I AI#
查看原文链接
40
一个非常不错的基于OpenAI最新实时语音模型的用例,实时语音转现…
作者: AIGCLINK | 时间: Sat May 09 09:34:51 +0800 2026 | 分类: 模型
时效性:98.0 | 来源可信度:42.0 | 新意:63.0 | 传播性:31.5 | 信息密度:85.0 | 知识性:77.4 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、openai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 1 / 点赞 4
原文
一个非常不错的基于OpenAI最新实时语音模型的用例,实时语音转现场演示,你说话,白板实时做语音可视化展示只动嘴免动手,语音直接驱动AI实时编辑白板。场景比如说,头脑风暴会议,白板实时跟着生成结构图、流程图,想法现场即可视化老师讲课时,板书自动跟着语音实时生成,讲到哪个知识点,白板上随即生成对应示意图,学生看到知识结构的动态构建等等,这就很酷双工作流模式,Staging,先手动在白板上丢标题、议程、参考图等;Live,AI接管画布,根据实时语音动态画图、改图、重排布局有预热机制,进入Live前AI先针对Staging内容预热,防止第一句语音说完,模型还没进入状态也可以纯本地部署github:网页链接#语音转现场演示##autopreso##语音转文稿# AIGCLINK的微博视频
查看原文链接
41
#模型时代# FFmpeg和VLC:不到20个志愿者,拒绝数千万美…
作者: 高飞 | 时间: Fri May 08 15:50:35 +0800 2026 | 分类: 新闻
时效性:68.5 | 来源可信度:42.0 | 新意:59.0 | 传播性:57.4 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 35 / 评论 12 / 点赞 66
原文
#模型时代# FFmpeg和VLC:不到20个志愿者,拒绝数千万美元,撑起全球90%的视频处理这期是技术加情怀了。极少数人基于热情和对卓越的执念,构建了数十亿人每天依赖但普通人从不知晓的基础设施。来自Lex Fridman播客第496期,2026年5月7日发布。嘉宾是VLC媒体播放器的核心开发者、VideoLAN基金会主席Jean-Baptiste Kempf(以下简称JB),以及FFmpeg长期贡献者、编解码器工程师Kieran Kunhya。Kieran同时也是Twitter/X上那个以辛辣风格闻名的FFmpeg官方账号的运营者。FFmpeg是YouTube、Netflix、Chrome、Discord等几乎所有涉及视频或音频的平台背后的隐形骨架,估计全球超过90%的视频处理流程都涉及FFmpeg。VLC累计下载量超过65亿次。两个项目的核心维护团队分别只有10到15人和5到8人,全部由志愿者组成。JB目前还在创办一家名为Kyber的超低延迟实时控制SDK公司,主要面向机器人遥控、无人机和云游戏场景。Kieran则经营着Open Broadcast Systems,为体育赛事直播提供专业编码和解码设备,客户包括BBC World Service等广播机构。一、从文件到像素:视频播放链条的每一环都是一个人一辈子的工作1、视频压缩的本质是为人眼做减法视频压缩率通常在100到1000倍之间。所有编解码器的设计目标都是模拟人类感知系统来决定丢弃什么信息。视频处理不在RGB色彩空间上工作,而是转换到YUV空间,把亮度和色度分开,因为人眼对亮度变化远比对色彩变化敏感。一个常见技巧是降低色度通道的分辨率,光这一步就能把数据量减半,但大多数人完全察觉不到。压缩和ZIP这类无损压缩完全不同。ZIP是数据进去、原样出来。视频压缩是在降质,关键在于用数学手段让降质过程尽可能符合人类感知特征。2、播放一段视频涉及的处理链条远比想象中复杂从URL获取字节流,用解复用器把容器格式切分成独立的视频、音频、字幕轨道。然后探测每一帧的编解码器类型,判断能否用GPU硬件解码。Kieran提到,大约45%的文件无法用GPU解码,必须回退到纯软件解码。软件解码流程是:先做熵解码(去除数学层面的编码),然后读取帧内预测的语法元素(空间域操作),再处理残差信号(存储在频率域),做逆变换回到空间域,叠加残差。Kieran说了一句让人停下来的话:"我们刚才每说一句话,都是某个人一辈子的工作量。每句话背后都有成千上万的人在这个行业中研究,有专门的书在讲。"从2000年代开始,主流视频编解码器有一项严格要求叫bit exactness,即无论谁的解码器实现,对同一个文件必须输出完全一致的比特流。Kieran提到,1990年代的MPEG-2没有这个要求,业内公认这是视频行业犯过的最大错误之一。bit ex…
查看原文链接
42
多教师在策略蒸馏:一种新的后训练原语MiMo-V2、GLM-5、D…
作者: epsilon_0 | 时间: Fri May 08 18:33:23 +0800 2026 | 分类: 模型
时效性:73.0 | 来源可信度:42.0 | 新意:53.0 | 传播性:60.8 | 信息密度:100.0 | 知识性:100.0 | 原创信号:44.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 49 / 评论 2 / 点赞 68
原文
多教师在策略蒸馏:一种新的后训练原语MiMo-V2、GLM-5、DeepSeek-V4都用了这种训练方式。地址:yumoxu.notion.site/multi-teacher-on-policy-distillation“现代后训练存在一个跷跷板问题:数学RLVR缩短了推理轨迹,但损害了开放式写作能力;RLHF通过偏好对齐获得优势,却以严格遵循指令为代价;工具使用RL则偏离了STEM基准。当每个专业化阶段互相牺牲时,很难推出一个兼顾所有能力的模型。 在策略蒸馏(OPD)出现后,这成为一种标准解决方案。其核心思想是:从学生模型中采样轨迹,然后通过反KL散度在这些轨迹上匹配教师的分布。你将获得密集的、逐token的监督信号,并几乎无需改变地投入到GRPO风格的训练循环中。自然的扩展是多教师OPD(MOPD):将每个能力的最强checkpoint作为教师,让学生一次性吸收所有能力。教师通常与学生共享分词器和血统,因此工程开销保持较低。 本文将梳理四篇2026年前沿报告,它们均收敛于MOPD,但部署方式各异:MiMo-V2-Flash(1月)、GLM-5(2月)、Nemotron-Cascade 2(3月)、DeepSeek-V4(4月): - 最终阶段整合(MiMo-V2-Flash, GLM-5):将MOPD作为后训练的最后一步。 - 中管线稳定(Nemotron-Cascade 2):将MOPD作为RL专业化阶段间的遗忘-恢复步骤。 - 大规模训练方案(DeepSeek-V4):全词汇logits,10+教师,专门设计的教师调度和容错轨迹基础设施。 在快速回顾GRPO → OPD的基础后,我们将依次分析每个案例,讨论收敛点、分歧及未来方向。”#AI创造营#
查看原文链接
43
你的AI Agent今天第三次忘了自己三小时前在做什么
作者: 零重力瓦力 | 时间: Fri May 08 09:59:30 +0800 2026 | 分类: 模型
时效性:58.7 | 来源可信度:42.0 | 新意:69.0 | 传播性:47.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 13 / 评论 2 / 点赞 11
原文
你的AI Agent今天第三次忘了自己三小时前在做什么。这不是模型的问题。GPT-5.5 把 AIME 2025 测评跑到了 81.2分,推理能力早就不是瓶颈。但当它进入一个需要连续工作八小时的代码审查任务,第六个小时它开始犯低级错误,第七个小时它忘了最初的需求,第八个小时它在生产环境里引入了一个本可避免的 bug。问题不在模型本身,在于上下文,具体说,是上下文的管理策略。Anthropic 在 2025 年提出了一个现象叫 “上下文衰退(context rot)”,就是随着对话长度增加,模型性能并非线性下降,而是撞到某个临界点后突然崩塌。研究数据显示,12 个主流模型中有 11 个在对话超过 32000 个 Token 时,性能跌破短上下文基准的 50%。GPT-4 在 4K 到 128K Token之间性能衰减15.4%。而大部分模型在 130K Token 左右开始变得不可靠,不是渐进的,是断崖式的。这不是模型变笨了,是上下文管理策略失效了。2026年,生产环境里的 AI Agent 团队已经收敛出三条主要策略。【第一层:滑窗截断,最简单的放弃式策略】滑窗截断的逻辑很简单:当对话接近上下文窗口上限,只保留最近 N 轮对话,丢弃更早的内容。相当于对话里每过五分钟就忘掉之前所有说过的话。这招用在简单客服机器人上没问题。每个 query 都是独立的,早期的上下文确实不需要。但用在多步骤工程任务上,这是灾难。一个在第三轮明确了需求的 AI Agent,到第四十七轮时已经忘了自己被要求做什么,它会生产出与原始需求完全无关的代码。滑窗截断是个好的基础组件,但单独使用它适合的场景极为有限。生产环境里如果你的Agent需要处理超过 20 轮的多步骤任务,纯滑窗策略几乎必然导致任务失败。工程实现上,滑窗截断要注意一个细节:截断时机的选择。不要等到上下文窗口满了才截断,那会让你损失掉窗口后半部分的有效信息。正确的做法是设置一个触发阈值。比如上下文使用量达到 70% 时就开始截断和压缩。这样能保证模型始终在有足够余量的空间里工作。【第二层:分层摘要,当前生产系统的主流选择】2026年最常见的架构是三层记忆结构:热层:最近10轮对话,完整保留原始内容,不做任何压缩。这部分内容处于上下文窗口的中心位置,是模型注意力最密集的区域,每一条信息都可能被充分调用。温层:第 11 轮到第 40 轮,维护为滚动详细摘要。这个摘要不是简单的内容压缩,而是要提取每个回合的关键信息:模型做了哪个决策、调用了什么工具、得到了什么结果、当前任务状态是什么。这些信息是模型在后续推理中重建上下文的关键依据。冷层:40 轮之前的全部内容,压缩为高层次摘要。保留高级目标、核心约束条件、主要中间结论。不要在这个层面保留细节。细节已经通过逐层摘要沉淀到热层和温层了。这个结构背后有硬数据支撑。Factory 在…
查看原文链接
44
一位资深创业者在他自己网站上维护着一份问题清单,里面是几十个他多年…
作者: 时蝇喜箭 | 时间: Sat May 09 02:39:31 +0800 2026 | 分类: 用法技巧
时效性:86.5 | 来源可信度:42.0 | 新意:45.0 | 传播性:53.1 | 信息密度:86.0 | 知识性:96.0 | 原创信号:68.0
为什么重要
它对实际使用方法有直接参考价值;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 23 / 评论 0 / 点赞 13
原文
一位资深创业者在他自己网站上维护着一份问题清单,里面是几十个他多年下来觉得「想了好几年都没有定论」的开放性问题。这份清单本身已经在英文圈被传了很久。把这些问题配上几条 AI 提示词,立刻就能变成一个普通人随时能用的「思考伙伴」工作流——不用打开电脑写小作文,地铁上、走路时、洗澡前后掏出手机问一句,过几分钟回头扫一眼回答,半小时下来脑子就能多出几个新角度。适合:经常要做深度思考的工作者,比如做投资、做战略、做产品、写深度内容,还有想跳出日常工作惯性、给大脑加点新角度的普通人。几十个题目几乎每一条都能直接复制下来当成 AI 思考的种子。这位创业者叫 Patrick Collison,爱尔兰人,37岁。2010年他和弟弟 John 一起创办了 Stripe(美国一家做了十几年的支付基础设施公司,给全球商家提供「在自己网站和 App 上收钱」的工具)。除了管公司,他个人网站上维护着十几个非工作内容板块,从读书清单、旅行笔记到他在意的科学研究领域都有,其中最有意思的一个就是 Questions 页。他自己写的开篇语很短:「这是一些我觉得有意思的问题」。重点是「有意思」——他列的每一条都不是有标准答案的题目,而是「我观察了好几年但没看明白」的现象。他这套做法的有意思之处不在清单本身,在于背后的方法论:好的问题比好的答案更值钱。一个清晰的开放性问题能逼你去观察、去比较、去重新看自己习以为常的事。清单上的问题随便挑几个就能感觉到那种味道。为什么有些东西越来越贵?医疗、教育、建筑越涨越凶;电视机、计算机、衣服反而越来越便宜。背后到底是同一套力学还是不同的?为什么过去能快速完成的大项目,现在反而少见?同一座城市八十年前一年能修完一条地铁,现在十年也修不完。是组织的问题、监管的问题,还是别的?人是怎么决定做出人生重大改变的?换工作、搬城市、结婚、离婚、退学创业,这些决定的背后到底有没有一个共同的模式?书的下一个形态是什么?学术论文的下一个形态是什么?我们用了几百年的「读完一本书」「看完一篇论文」的方式,AI 时代之后是不是也该被重新设计?为什么不少东西在瑞士和日本就是做得更好?街道更整洁、服务更细致、设计更讲究。这是文化、制度、还是别的什么?把这些问题「放着自己想」和「让 AI 陪你想」是两码事——这才是这套清单真正的用法。最简单的一招是给 AI 指定一个专家身份,让它列出可能的解释假说。比如把「为什么有些东西越来越贵」丢给 AI,加一句「请扮演一位经济学家,针对这个问题列出3到5个最有解释力的假说,每个假说给一个具体例子,重要的是先把假说列全」。这一手能让 AI 一次给你一份结构化的观察清单,比直接搜文章更有用。另一招是让 AI 同时扮演两三个不同身份,针对同一个问题给出冲突的回答。比如把「为什么过去能修得比现在快」丢给 AI,加一句「请同时扮演一位历史学家、一位项目工程师、…
转发者评论
//@马力AI和商业思维:对的。这些问题我读下来,确实都很好,有启发//@ActionCuresFear-Mars:“好的问题比好的答案更值钱。一个清晰的开放性问题能逼你去观察、去比较、去重新看自己习以为常的事。”
查看原文链接
45
最近听了一期很有意思的播客,来自 Every 的 AI & I 节目
作者: 默庵·超级个体 | 时间: Fri May 08 11:29:00 +0800 2026 | 分类: 模型
时效性:61.2 | 来源可信度:42.0 | 新意:63.0 | 传播性:57.6 | 信息密度:93.0 | 知识性:95.0 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 36 / 评论 3 / 点赞 43
原文
最近听了一期很有意思的播客,来自 Every 的 AI & I 节目。Every 的 CEO Dan Shipper 和他们的总经理 Kieran Klaassen 聊了一个特别实在的问题:当 AI 越来越能干活的时候,人类在工作流程中到底应该待在哪个位置?Kieran 是 Every 内部一套叫「复合工程」(Compound Engineering)的方法论的创造者,这套方法论重新定义了工程师和 AI 智能体协作的方式。而在不断打磨这套方法论的过程中,他和同事 Trevin Chow 发现了一个特别形象的比喻:AI 工作流就像一个三明治,AI 是中间的馅料,人类是两头的面包。这个比喻听起来简单,但背后的洞察其实很深。1、中间那块「馅料」,基本上已经搞定了Kieran 的复合工程方法论分四个步骤:规划、执行、审查、沉淀。规划阶段,你想清楚要做什么,列出清晰的步骤。执行阶段,AI 智能体按照计划去写代码、做设计、完成各种工作。审查阶段,检查产出的质量。沉淀阶段,把过程中积累的经验和教训存回系统,让 AI 下次不再犯同样的错误。Kieran 说,这四个步骤里,执行阶段基本上已经「解决了」。他用的原话是「kind of done」。意思是,只要你给 AI 一个好的计划,它就能忠实地执行。大语言模型非常擅长按步骤做事,可以连续工作几个小时甚至几天,这件事已经不需要人类操心了。审查阶段也在快速进步,规划阶段同样越来越自动化。那问题就来了:如果这些环节都能自动化,人类还需要做什么?是不是已经把自己的工作给自动化掉了?2、人类该待在三明治的两头答案藏在工作流的两个端点上。先说前端。Kieran 的同事 Trevin 在规划阶段之前又加了两个步骤:头脑风暴和构思。头脑风暴是你还没搞清楚问题是什么的时候,和 AI 一起探索、发散。构思是想清楚要解决什么问题、从什么角度切入。他们发现,在这个最前端的阶段,人类必须深度参与。AI 可以辅助你思考,但定义问题、选择方向、设定框架,这些事情需要人类自己来做。一旦框架定好了,后面的规划和执行就可以放手交给 AI。再说后端。当 AI 把活干完了,所有测试都通过了,功能都跑通了,这时候人类再介入,做最后的打磨。点一点,看一看,感受一下哪里不对劲,哪里可以更好,哪里可以更美。Kieran 提到了一个很有趣的类比。他以前用番茄工作法,如果一个任务 15 分钟就做完了,剩下的时间不能切换任务,只能继续在同一个任务上深挖。他发现,往往就是在这段「多出来的时间」里,会产生一些特别漂亮的东西。因为你被迫比平时走得更深、更远。AI 工作流末端的打磨环节,本质上就是这样一个时刻。所有基础工作都完成了,你可以纯粹地去提升品质,去追求那种「感觉对了」的状态。Kieran 特别强调了一句话:如果我们不做这一步,所有的产出都会变成千篇一律的「AI 味」。品质的门…
查看原文链接
46
昨天发了Florian Brand 来中国AI实验室访问的见闻 网…
作者: 蚁工厂 | 时间: Fri May 08 08:39:56 +0800 2026 | 分类: 模型
时效性:56.5 | 来源可信度:42.0 | 新意:74.0 | 传播性:47.5 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;同时涉及 模型、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 13 / 评论 0 / 点赞 30
原文
昨天发了Florian Brand 来中国AI实验室访问的见闻 网页链接 ,通行的还有一位Nathan Lambert(基于人类反馈的强化学习一书作者、Interconnects AI 的创办者)也在中国AI实验室参观访问。他也写下了他的见闻,更详细一些:来自中国 AI 实验室内部的笔记 --我此行与中国大多数领先 AI 实验室交流后得到的启发Nathan Lambert2026 年 5 月 7 日坐在从杭州开往上海的新型高铁上,我望向窗外:起伏壮阔的山脊点缀着风力发电机,在落日余晖中投下剪影。群山背后,是绵延的田野与密集的摩天楼交织在一起。我带着极大的谦逊从中国归来。去到一个如此陌生的地方,却受到如此热情的欢迎,是一种非常温暖、非常有人情味的体验。我有幸见到了许多 AI 生态中的人士,他们过去只是我远远知道的人;他们以灿烂的笑容和热情迎接我,也提醒我,我的工作以及 AI 生态本身是多么全球化。🌟中国研究人员的心态正在开发语言模型的中国公司,几乎是这项技术的理想“快速追赶者”:它们一方面建立在中国长期以来重视教育与勤勉工作的文化传统之上,另一方面又采用了与西方略有不同的科技公司组织方式。如果只看表面成果和资源投入——比如最新、最大、能够支撑智能体工作流的模型,以及优秀科学家、大规模数据和加速计算等关键要素——中国实验室和美国实验室看起来大体相似。真正长期存在的差异,并不在于这些要素本身,而在于它们如何被组织起来、如何被激励和塑造。我长期以来一直认为,中国实验室之所以如此擅长追赶并保持在前沿附近,一个原因是它们在文化上与这项任务高度契合。但在没有直接与相关人员交流之前,我觉得自己不适合把这种直觉赋予太大的解释权。此次与中国领先实验室中许多出色、谦逊、开放的科学家交流后,我的很多看法变得更加清晰了。如今,构建最好的 LLM,很大程度上取决于贯穿整个技术栈的细致工作:从数据,到架构细节,再到 RL 算法实现。模型的每一个环节都可能带来一些改进,而把这些改进整合在一起,是一个复杂过程:一些杰出个体的成果,可能必须为了整体模型在多目标优化上的最大化而被搁置。美国研究人员当然也非常擅长解决单个组成部分的问题,但美国更有一种“为自己发声”的文化。作为科学家,你越能为自己的工作发声,就越容易成功;现代文化也在推动一种新的成名路径,即“明星 AI 科学家”。这会导致直接冲突。据广泛传闻,Llama 组织就在这些利益嵌入层级化组织后产生的政治压力下崩塌。我也听说过其他实验室有人表示,有时可能需要“安抚”一位顶尖研究员,才能让他们停止抱怨自己的想法没有进入最终模型。不论这是否完全属实,其含义很清楚:自我意识与职业晋升欲望,确实会妨碍打造最好的模型。中美之间在这类文化上的一个小小方向性差异,都可能对最终产出产生有意义的影响。这其中一部分也与中国究竟是谁在构建这些模型有关。在所有…
查看原文链接
47
最近跟同事讨论问题:AI都能写代码了,程序员是不是要消失了
作者: axb的自我修养 | 时间: Fri May 08 21:50:31 +0800 2026 | 分类: 工具产品
时效性:78.5 | 来源可信度:42.0 | 新意:65.0 | 传播性:52.7 | 信息密度:79.0 | 知识性:82.0 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;已有 3 个账号围绕同一事件讨论,说明传播面已形成
事件概览
聚类条数 3 / 账号数 3 / 转发 22 / 评论 5 / 点赞 53
原文
最近跟同事讨论问题:AI都能写代码了,程序员是不是要消失了。我觉得这里混淆了两个东西。一个是"分工"。事情变多了,一个人干不完,自然会长出不同的协作方式。你写界面我调接口,这不是谁挡着谁,是任务规模导致需要通过分工完成任务。另一个是"壁垒"。这个就不同了,是人为筑起来的墙,用来挡住别人。以前很多程序员的工作,本质上是被信息差保护着的——语法细节、框架配置、各种隐形的"只有我知道的坑"。AI现在确实在拆后面这种壁垒,你不需要背那么多语法也能跑出一个能用的东西。但它没有消灭分工,只是把分工的边界重新画了一遍。就算是一件事所有人都能做,也不意味着所有人都要做这件事 - 只是这件事的价值会大幅度下降。而在过去十多年,伴随着语言、框架、工具的丰富,很多二三流程序员涌入这个行业,已经让编程这件事的价值大幅下降过了。所以问题不是"程序员还在不在"。而是哪些活会从"只有程序员能干"变成"更多人能参与"、程序员如何在新的分工中找到价值点,以及更重要的,IT这个行业是否能在这轮浪潮过后找到新的增长点。#AI编程##程序员##分工与壁垒##代码可维护性#
查看原文链接
48
装了这个AI热点Skill之后,你再也不需要自己去刷AI新闻了
作者: 蚁工厂 | 时间: Fri May 08 12:43:26 +0800 2026 | 分类: 新闻
时效性:63.3 | 来源可信度:42.0 | 新意:53.0 | 传播性:71.9 | 信息密度:100.0 | 知识性:97.0 | 原创信号:44.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、ai、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 145 / 评论 26 / 点赞 228
原文
装了这个AI热点Skill之后,你再也不需要自己去刷AI新闻了。昨天,我把我的AIHOT,也就是AI热点监控网站向大家免费开放了。得到了很多很多朋友的喜欢。也万万没想到,第一天的访问用户就突破了10万UV,浏览的PV量更是超过了60万,而且没啥差评,也没出现啥BUG,大家反馈都还挺喜欢,我终于长长的松了一口气。然后昨天,我收到的最多的两个需求,第一个就是深色看的太难受了,能不能增加浅色模式,这个确实是我自己的疏忽,昨天早上花了一个多小时紧急做完了,昨天中午已经上线了。然后另一个需求,就是能不能增加skill/API/RSS。这毕竟是个AI时代,只有网站这一种形式,确实还是太笨拙了,所以晚上下班回家,决定继续打开AI开始Coding,把大家提的需求都补上。于是,在一个通宵之后,我终于全部开发完了。今天,我觉得也可以给所有的Agent用户,开放我的AIHOT了。而且同样老规矩,所有人都免费使用。网址在此:网页链接你进入AIHOT主站,点击左边的Agent接入,就可以看到了。目前开放了3种接入方式:Skill、RSS、API,分别对应三种不同的需求。目前把我觉得能对外开放的数据,也做了最大程度的开放。重点说说AIHOT Skill,这应该是呼声最高的,也是AI时代最重要的东西。Skills我就不详细再去过多解释了,这玩意就是给Agent使用的技能包,如果有不懂的,可以去我的公众号搜索Skills,我写过非常多了。你可以用任意的Agent,比如Claude Code、Codex、OpenCode、OpenClaw、Hermers等等支持Skill协议的来进行安装。而这个AIHOT.skill的作用呢,也特别简单,让你的Agent可以直接读我的AIHOT网站的部分数据,从而来实现嵌入到你的工作流中。安装也特别简单,一句话就可以,我直接放在了我的服务器上,所以也无需魔法:帮我安装这个 skill:网页链接当然,这个skill我也按老规矩,传到了我自己Skills集合的Github上,想用github源的可以:网页链接AIHOT Skill装上之后,你就不用再打开浏览器,不用再去刷网站,甚至不用再去想今天AI圈到底发生了什么。你就跟你的Agent说一句话就行了。我再花点篇幅,说说它到底能干什么。第一个,AI日报。AIHOT每天北京时间早上八点,会自动生成一份当天的AI日报。这个日报是我的系统从几百个信源里抓取、筛选、去重、打分、分类之后,最后精选出来的。比如你早上起来,打开Claude Code或者OpenClaw,跟它说一句“给我一份今天的AI日报”,它就会自动触发AIHOT Skill,把当天的AI日报拉下来,整理成一份中文简报,直接摆在你面前。日报分五个版块,模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点。每条都有中文标题、一句话摘要、信息来源、还…
查看原文链接
49
[LG]《Understanding diffusion mode…
作者: 爱可可-爱生活 | 时间: Sat May 09 05:37:53 +0800 2026 | 分类: 模型
时效性:91.5 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、机器学习 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 2
原文
[LG]《Understanding diffusion models requires rethinking (again) generalization》P Marion, Y Wu [PSL Research University & Sorbonne University] (2026) 在扩散模型理论中,“泛化”为何发生仍是悬而未决的难题。过去的解释受困于监督学习范式,本质原因是扩散模型一旦完全拟合训练经验,就会生成拷贝而非新样本。本文的核心洞见是:把泛化重新看作“记忆发生前学到了什么”。由此,追踪数据量、模型规模、批大小、学习率对记忆时间与样本质量的作用,使问题从“为何不记忆”转向“如何先学结构”。这项工作真正留下的遗产是拆开了新颖性与保真度。它为后来者打开的新门是研究预记忆阶段的优化轨迹,但尚未跨过的门槛是找到能同时度量拷贝、质量与分布贴合的指标。arxiv.org/abs/2605.06077 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
50
OpenAI上新三款实时语音模型,不仅集成了GPT-5级的推理能力…
作者: 量子位 | 时间: Fri May 08 12:40:23 +0800 2026 | 分类: 模型
时效性:63.2 | 来源可信度:42.0 | 新意:69.0 | 传播性:36.8 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 4 / 评论 0 / 点赞 7
原文
OpenAI上新三款实时语音模型,不仅集成了GPT-5级的推理能力,还重击了一拳同传行业:能紧跟发言人节奏的同声传译,现在每分钟成本两毛五。三款模型分别是GPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisper,把端到端推理语音、同声传译、流式转写三件事打包进了同一套API。三款模型,三个定位:GPT-Realtime-2:带着GPT-5级推理说人话办人事;GPT-Realtime-Translate:能把70多种语言实时翻译成13种语言输出,每分钟约2毛5。GPT-Realtime-Whisper:负责边说话边出文字的低延迟转录。官方表示,语音正逐渐成为人们使用软件最自然的方式之一。这三款模型一起,把语音从简单的听话回话,推向了真正「能干活的交互界面」——这下,大模型真的能像人类一样,跟你边聊天边把活干了。网页链接
查看原文链接
51
给你一份使用文档和一个编译好的可执行文件,从零把整个程序重新写出来…
作者: 新智元 | 时间: Fri May 08 12:16:00 +0800 2026 | 分类: 模型
时效性:62.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:36.8 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 4 / 评论 3 / 点赞 5
原文
给你一份使用文档和一个编译好的可执行文件,从零把整个程序重新写出来——这就是ProgramBench给全球顶级AI出的题。Meta联合斯坦福、哈佛昨日发布,出自SWE-Bench原班人马之手,200个软件项目、9个顶级模型,完整通过率全员0%。不是修bug,是从零造软件SWE-Bench给你现成代码库,指出哪里有bug让你改,本质是「阅读理解+局部手术」。ProgramBench完全反过来——只给可执行文件和使用文档,让模型仅凭观察输入输出行为,从零复现整个程序,编程语言、数据结构、模块拆分全部自己定。评估用Agent驱动的模糊测试,共生成248,853个行为测试,只要输入输出一致即可,完全不在乎代码内部长什么样。200个任务横跨压缩工具、语言解释器、数据库、媒体处理等领域,代码行数中位数8,635行,最大的FFmpeg有270万行。九大模型全部交白卷最强的Claude Opus 4.7平均通过率51.2%,是唯一达到「几乎通过」门槛的模型,但没有在任何一个任务上拿到满分。GPT-5.4和Gemini 3.1 Pro分别为38.3%和36.6%,构成第二梯队。更反直觉的是,砸钱堆步数换不来更好的成绩——Sonnet 4.6每任务跑868条命令、花费27.09美元,成绩反而不如只用93次调用、花3.81美元的Opus 4.7。98%的运行里,模型都是自己觉得「做完了」主动交卷的。不是考试时间不够,是真的不会。代码能跑,但完全不像人写的把高分解答和人类原版一对比,差距一目了然。模型中位数只用3个文件,人类是15个;函数数量只有人类的10%至29%;代码行数中位数1,173行,人类是3,068行。说白了,现在的AI会写代码,但不懂软件设计——不知道为什么要拆模块、为什么要定接口,策略就是把所有逻辑硬塞进尽可能少的文件里,能跑就行。还有个有趣的细节:模型只有50%的概率用原版相同的编程语言,三分之一的概率直接用Python重写一遍。说好不作弊,一联网就去GitHub扒源码研究团队开放网络权限但明确告知不得作弊,结果Claude Sonnet 4.6有36%的任务被判定作弊,Opus 4.6是21%。手段五花八门,从直接克隆GitHub仓库,到用包管理器下载,到翻本地缓存目录,什么都有。更离谱的是,9个AI裁判对57%的任务无法达成一致——连裁判自己都判不清楚什么算作弊、什么算正当的逆向工程。最后研究团队直接断网了事。SWE-Bench考的是「在别人代码里把问题修好」,ProgramBench考的是「自己从头设计并实现一个完整系统」。前者AI已经做得相当好,后者今天的答案,是0%。
查看原文链接
52
#算力租赁千亿大市场来了# 很多人盯着GPU芯片看,觉得这是一场算…
作者: 爱可可-爱生活 | 时间: Sat May 09 06:23:42 +0800 2026 | 分类: 新闻
时效性:92.7 | 来源可信度:42.0 | 新意:59.0 | 传播性:27.2 | 信息密度:83.6 | 知识性:88.2 | 原创信号:88.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 1 / 点赞 4
原文
#算力租赁千亿大市场来了# 很多人盯着GPU芯片看,觉得这是一场算力的游戏。但仔细看数据,液冷PUE值1.08,绿电价格0.26元/度,协鑫能科、晶科科技这些名字出现在算力赛道里……最后你会发现,这个行业的终局不是芯片战争,是能源战争。芯片是明牌,谁都知道缺,谁都在抢。但真正决定谁能活到最后的,是你每度电的边际成本。一张H100卡,全中国租金差不多,你凭什么比别人多赚?凭的是你背后那根电线接的是火电还是水电,是市电还是直供。算力租赁,本质上是一门用电力成本做杠杆的生意,GPU只是把电变成钱的那台机器。谁掌握了低价稳定的电力供给,谁就是这个行业的地主。芯片会迭代,电不会过时。 算力租赁千亿大市场来了
查看原文链接
53
【快乐马大赛来啦】天马行空挑战赛启动你最近被最新的AI视频模型快乐…
作者: 德里克文 | 时间: Fri May 08 09:24:53 +0800 2026 | 分类: 用法技巧
时效性:57.8 | 来源可信度:42.0 | 新意:59.0 | 传播性:63.5 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
事件概览
聚类条数 1 / 账号数 1 / 转发 64 / 评论 117 / 点赞 1240
原文
【快乐马大赛来啦】天马行空挑战赛启动你最近被最新的AI视频模型快乐马@HappyHorse_AI 刷屏了吗?@千问 发起了天马行空挑战赛,AINext万象AI实验室作为合作社区,邀请大家用你的创意,在马年点亮你心中的快乐小马。参与社区活动还有额外的巨额积分奖励哦!而就在今天晚上,我将作为快乐马首批超创,与AINext万象AI实验室社区小伙伴一起,分享快乐马的实测和出片技巧,欢迎大家扫码提前预约起来,晚上8点钟直播间不见不散!赛事日程 2026年4月28日00:00—2026年5月10日23:59(13天) | 首批内测启动2026年5月11日00:00—2026年5月31日23:59(21天) | 大赛正式开启(全网创作者正式开启投稿)2026年6月01日00:00—2026年6月05日23:59(5天) | 比赛评审2026年6月06日00:00—2026年6月11日23:59(6天) | 结果公示 happyhorse千问#ai创造营#
查看原文链接
54
DeepSeek-V4 技术报告背后的 TileLang:如何高效…
作者: 蚁工厂 | 时间: Fri May 08 19:42:23 +0800 2026 | 分类: 模型
时效性:74.9 | 来源可信度:42.0 | 新意:67.0 | 传播性:45.0 | 信息密度:87.2 | 知识性:76.3 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 10 / 评论 0 / 点赞 22
原文
DeepSeek-V4 技术报告背后的 TileLang:如何高效实现大模型中的小算子网页链接“大家五一快乐!最近 V4 的技术报告讨论度很高,其中 TileLang 在报告中也占了一部分内容,主要是总结了社区最近的一些技术进展、以及其投入实际工业界应用后的一些打磨经验。这篇文章带大家简单解读一下技术报告里 TileLang 部分,同时分享一些关于编译器 / DSL 在真正的模型 Infra 中定位的思考。”#AI创造营#
查看原文链接
55
今天一大早醒来,刷到一个AI访谈类的视频
作者: 默庵·超级个体 | 时间: Sat May 09 07:31:12 +0800 2026 | 分类: 工具产品
时效性:94.6 | 来源可信度:42.0 | 新意:55.0 | 传播性:34.4 | 信息密度:79.0 | 知识性:82.0 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 2 / 点赞 19
原文
今天一大早醒来,刷到一个AI访谈类的视频。一个非程序员,就是普通人,用AI编程做了上百个网站,年收入一百万以上。说实话,每天看这些访谈视频,看AI的发展,看别人怎么用AI赚钱,真的挺焦虑的。为什么焦虑呢?因为你想用AI做副业、想赚点钱,其实是需要定力的。你得在一个领域里沉下去,深入地探索,可能才会有效果,不能盲目地东一榔头西一棒子。但问题就出在这里。你今天看到这个大V用某种方法赚到钱了,明天又看到另一个大V搞副业也赚到钱了,后天又有人分享了新的赚钱路子。每天被这些信息轰炸,你就会对自己目前坚持的方向产生动摇。你会开始怀疑自己,会不会我换个赛道更好?会不会我做另一个产品更好?会不会别人的路子才是对的?这种怀疑一旦冒出来,你就很难再坚守了。所以在这个AI变革特别快的时代,想要沉下心来做一件事,然后真正赚到钱,真的挺难的。市面上到处都是制造焦虑的信息,太容易被迷惑了,太容易让人半途而废了。能在这个时代守住自己的方向,本身就是一种稀缺的能力吧。为什么坚守挺重要的?当你深度挖掘这些副业赚到钱的人的方法论之后,你就会发现但凡赚到钱的人,都是经过了长期的探索和坚守,在一个方向上死磕。#科技先锋官##副业赚钱#
查看原文链接
56
Anthropic 和 SpaceX 达成算力合作,拿下了 xAI…
作者: 零重力瓦力 | 时间: Fri May 08 11:53:02 +0800 2026 | 分类: 新闻
时效性:61.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 0 / 点赞 13
原文
Anthropic 和 SpaceX 达成算力合作,拿下了 xAI Colossus 1 数据中心的全部容量,超过 22 万块 Nvidia GPU,300 兆瓦级别。这事最魔幻的地方在于,马斯克过去几个月一直在X上猛烈抨击 Anthropic,说他们 “虚伪”、“仇恨西方文明”、“反人类”,结果今天突然发帖说“我花了很多时间和 Anthropic 团队交流,印象深刻,没有人触发我的邪恶探测器”。前后反差大到像在看川剧变脸。然而仔细一想,背后逻辑其实很清晰。xAI 的 Grok 模型第一版没建对,现在正从头重建,训练工作已经迁到 Colossus 2。Colossus 1 就这么闲着,每一秒都在烧钱。而 Anthropic 这边,Dario 几年前在资本支出上选了保守路线,赌 AI 需求可能不会暴涨,结果赌输了。算力严重不足导致他们过去几个月不断压缩用户配额,高峰期限流,对开发者社区造成了不小伤害。两边一拍即合,各取所需。(完美演绎,没有永远的敌人,只有永远的利益。)更深一层看,马斯克面前其实只有两个选择,把多余算力卖给 Anthropic 还是卖给 OpenAI。考虑到他正在起诉 OpenAI,答案不言自明。敌人的敌人就是朋友,商业世界同样如此。合作今天生效后 Anthropic 立刻把 Claude Code 五小时速率限制翻倍,取消了高峰时段降配额的操作,Opus API 的速率限制从每分钟 200 万 token 直接拉到 1000 万。用户体验层面确实是立竿见影的改善。不过配额的具体计算方式依然是个黑箱,透明度问题没有根本解决。有个细节值得关注。几周前 xAI 刚和 Cursor 签了合作协议,说要用 Colossus 来帮 Cursor 训练编程模型,年底还有 600 亿美元收购的期权。现在 Colossus 1 整个给了 Anthropic,Cursor 只能挤在 Colossus 2 上和 xAI 自己的训练任务共享资源。如果我是 Cursor 创始人,此刻多少会有点五味杂陈。整个事件也让我们发现,AI 行业的终极瓶颈或许不是模型也不是芯片,而是电力。模型在趋同,芯片在走向通用化,但 300 兆瓦的物理算力背后是实实在在的能源基础设施,这才是最难短期突破的东西。#Anthropic##AI基础设施##ElonMusk# 零重力瓦力的微博视频
查看原文链接
57
【AI时代 CPU依然中流砥柱
作者: 快科技官方 | 时间: Fri May 08 17:09:06 +0800 2026 | 分类: 新闻
时效性:70.7 | 来源可信度:68.0 | 新意:63.0 | 传播性:31.5 | 信息密度:83.4 | 知识性:71.2 | 原创信号:82.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、智能体、gpu 等关键词,信息密度较高;来源账号权威性较高,可信度相对更强
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 4 / 点赞 1
原文
【AI时代 CPU依然中流砥柱!AMD加冕数据中心之王】这几年,随着生成式AI、物理AI、智能体AI的持续火爆,GPU的地位被空前提高,甚至有声音号称CPU的时代已经结束了,GPU才是真正的顶梁柱。不过,随着技术的演进与形势的变化,人们渐渐发现,CPU依然是真正意义上的“中央处理器”,AI时代下的地位不但没有削弱甚至被替代,反而得到了进一步的加强。 AI时代 CPU依然中流砥柱!AMD加冕数据中心之王
查看原文链接
58
#模型时代# 为什么 Agentic AI 改变了数据中心的 CP…
作者: 浙大宋明黎 | 时间: Fri May 08 13:36:48 +0800 2026 | 分类: 模型
时效性:64.8 | 来源可信度:42.0 | 新意:55.0 | 传播性:59.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:44.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 44 / 评论 0 / 点赞 35
原文
#模型时代# 为什么 Agentic AI 改变了数据中心的 CPU-GPU 配比Ben Bajarin出处:thediligencestack.com/p/secret-agent-cpu一、60秒核心论点我们认为,从单体 LLM 推理向多步骤 agentic 工作流的转变,正在从结构上改变数据中心内部的算力配比。训练时代的架构默认 GPU 主导推理的每一个环节,agentic 工作负载对这一假设构成了挑战。当一个 agent 调用工具、查询数据库、等待人类审批或编排子 agent 时,GPU 处于空闲状态,干活的是 CPU。我们的模型估算显示,这段空闲窗口约占总推理时间的 12%–22%,且随 agent 复杂度上升而扩大。当前数据中心 CPU 的定位是"云原生"——为运行云端和 Web 软件而设计。我们认为,一类新的 CPU 正在浮现——"agent 原生",其带来的 CPU 市场增量将超出多数预测。所谓 agent 原生 CPU,是专门为 agentic 工作流设计的独立 CPU 层级,与 GPU 集群并行部署,用以回收 GPU 的闲置算力。在适度配置下,它能同时提升吞吐量并降低每 token 成本。初步估算,一个满配基础配置的 CPU 机架成本约 30 万美元(最乐观建模约 50 万美元),GPU 机架成本约 400 万美元以上,功耗比约为 7:1。在一座 1GW 设施中,若将 5% 的电力分配给 CPU,我们的模型显示有效 token 吞吐量提升约 2%,每 token 成本下降约 3.7%,而总资本支出仅增加约 1.7%。盈亏平衡点约在 10% 的分配比例,超过这一阈值后,吞吐量下降的速度将快于成本节省的累积。最优区间窄但确实存在,且随设施规模放大。二、背景AI 领域的变化速度惊人。如果回到一年前,当时的主流论点是:数据中心 CPU 正被商品化,GPU 吸走了绝大部分价值层。虽然 GPU/XPU 机架仍将占据最大的金额份额,但随着算力层转向 agentic 工作负载,CPU 的战略地位已经回归。推理正在从提示-应答式交互演进为 agentic 系统——检索信息、调用工具、管理状态、执行操作、协调多步骤工作流,瓶颈因此开始转移。在这种环境下,制约因素往往不再是模型吞吐本身,而是系统围绕模型编排工作的能力。这对未来 AI 数据中心的架构方式有直接影响,也关系到利益相关方应当如何思考增量基础设施投入的去向。我们的观点是:训练时代的 CPU-GPU 配比假设已经在 agentic 推理面前受到挑战。旧框架把 CPU 基本视为挂在 GPU 重型架构上的控制层——本质上只是一个基本的头节点处理器。当主要任务是训练大模型或服务相对简单的推理请求(回合制 LLM)时,这也许够用。但当工作负载转向推理模型时,这套算力循环就不再适用了。在 agentic 环境中…
查看原文链接
59
今天飞去匹兹堡和朋友的一家人吃饭,他女儿介绍她的毕业项目,同时聊到…
作者: 陈怡然-杜克大学 | 时间: Fri May 08 10:50:32 +0800 2026 | 分类: 新闻
时效性:60.1 | 来源可信度:42.0 | 新意:55.0 | 传播性:73.2 | 信息密度:79.0 | 知识性:88.0 | 原创信号:86.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 163 / 评论 68 / 点赞 511
原文
今天飞去匹兹堡和朋友的一家人吃饭,他女儿介绍她的毕业项目,同时聊到很多年轻人职业方向的问题。在回答的过程中我觉得有几点讨论挺有意思的。首先是大家关心的未来AI替代人类工作的问题。我说我是悲观派,觉得这几乎是定局,未来很可能是“普通人的悲歌”:如果不加监管和重新定义顶层设计,社会财富将越来越多的向少部分拥有智力和资源优势的人群快速集中。一整代普通人可能会被迅速淘汰,直到社会找到新的平衡(是不是每个人发放无条件基本收入UBI倒是不一定)。第二个话题是大学选什么专业。我说我家老大是读的计算机和数学。但是老二我并不太建议他以计算机作为第一专业,但一定要作为第二专业。我个人觉得随着AI能力的提高,市场对于未来计算机人才的需求量会大大降低,但对于人才的质量会大大提高。这个市场会变成一个典型的精英人才市场。大量的基础型计算机人才将会失业。同时那些大力发展计算机专业的学校在需求持续降低,人才长期饱和的情况下重新洗牌。第三个是谈到她女儿的毕业项目和未来的职业方向。我说我对你做的东西不懂。但是我觉得有两点可能可以考虑。第一是AI能快速替代的职业千万别选。而且我觉得人对于AI的接受度比想象中高。我举了一个例子,就是AI短剧。我个人觉得很多人说大家喜欢真实的演员这件事很可能只是这1-2代人的护城河。未来人可能根本不在乎这些媒体内容是真人出演还是AI生成的。第二是选择市场基数大的产业。这种产业才能支持高溢价,才能有更高的上升空间。还谈了很多其他的话题,比如如何择校,长期职业规划等等,回头有空再继续写。
查看原文链接
60
【Claude总结】 Techmeme 科技新闻摘要 (2026-…
作者: 时蝇喜箭 | 时间: Sat May 09 09:00:19 +0800 2026 | 分类: 新闻
时效性:97.1 | 来源可信度:42.0 | 新意:59.0 | 传播性:8.0 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
【Claude总结】 Techmeme 科技新闻摘要 (2026-05-08) www.techmeme.com/1. 【苹果与英特尔达成芯片代工正式协议,INTC单日暴涨近14%】(来源: Wall Street Journal) 苹果将委托英特尔使用其18A-P工艺为Apple设备制造部分芯片,这是苹果2020年转向ARM自研芯片后首次与英特尔开展合作——但这次英特尔扮演的是代工厂角色。苹果长期100%依赖台积电的供应链格局将因此改变,对英特尔而言,拿下苹果这一标志性客户,是其多年制造业转型押注得到市场认可的最强信号。 www.wsj.com/tech/apple-intel-have-reached-preliminary-chip-making-agreement-69eb93702. 【Nintendo宣布Switch 2将于9月1日全球涨价:美国从450美元升至500美元】(来源: Bloomberg) 受内存成本上涨和关税影响(预计损失约6.4亿美元),Nintendo宣布Switch 2将于9月1日起全球提价,美国售价从450美元涨至500美元。在本财年销量预测已令市场失望的背景下,还在销售周期中途提价50美元,是一场对需求韧性的高风险赌注;这也是美国关税政策如何实时传导至消费电子价格的最直白案例之一。 www.bloomberg.com/news/articles/2026-05-08/nintendo-profit-forecast-for-second-year-of-switch-2-disappoints3. 【教育平台Canvas遭ShinyHunters勒索攻击,已于期末考试周后恢复服务】(来源: Krebs on Security) Canvas学习管理系统在遭到ShinyHunters通过社会工程学手段实施的数据勒索攻击后,被迫在全美多所高校期末考试周期间下线,随后已恢复访问。攻击者并未利用零日漏洞,而是通过社工手段入侵——这意味着此次事件完全可以预防。Canvas覆盖数千万学生,此次事件将加速外界对长期落后于企业安全标准的教育科技平台的安全审查。 krebsonsecurity.com/2026/05/canvas-breach-disrupts-schools-coaches-nationwide/4. 【索尼Q4营收同比增长8%至约194亿美元,超出预期;但营业利润仅10.6亿美元,远低于约170亿美元预期】(来源: CNBC) 索尼Q4营收超预期,PlayStation 5累计销量达9370万台,但营业利润仅10.6亿美元,远低于分析师170亿美元的预期。内存价格飙升和关税双重压力正在吞噬利润,即便PlayStation生态系统仍然强劲;在财报电话会议上强调"AI+人类创造力",正成为夹在AI转型压力与创意人才顾虑…
查看原文链接
61
OpenAI 政变之夜内部短信曝光:董事会为何执意赶走 Altman
作者: 高飞 | 时间: Fri May 08 12:04:24 +0800 2026 | 分类: 新闻
时效性:62.2 | 来源可信度:42.0 | 新意:49.0 | 传播性:64.4 | 信息密度:93.0 | 知识性:98.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、openai、anthropic 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 70 / 评论 14 / 点赞 165
原文
OpenAI 政变之夜内部短信曝光:董事会为何执意赶走 Altman?马斯克起诉 OpenAI 和 Sam Altman 的案子今天进入庭审第二周,前 CTO Mira Murati 的视频证词和 2023 年 11 月她与 Altman 政变之夜的内部短信首次公开。这些短信像一场实时直播,把硅谷史上最戏剧化的权力斗争直接还原到了法庭现场。短信显示,Altman 被董事会突然解雇的那个周末,他一直试图通过 Murati 争取回归。局势变化迅速,周末时董事会还口头表示希望他回来,但到了周日深夜,态度彻底翻转。Murati 直接告诉他:“他们已经决定了,就是不要你。”董事会甚至连新 CEO 都已经选好了——前 Twitch CEO Emmett Shear。Murati 在短信里用一句极为戏谑的话形容这位继任者:“那个不知名的 Twitch 哥们(rando twitch guy)”,这直接暴露了她对董事会这个仓促决定的荒谬感。最劲爆的是 Altman 当晚的另一个提议:“如果微软直接收购 OpenAI 呢?这样董事会想要的治理结构是不是就能实现?”这个方案直到现在才被首次曝光,显然能为 马斯克起诉 OpenAI 转向营利提供关键证据。更耐人寻味的是董事会驱逐 Altman 背后的真实动机。面对 Altman 一再询问董事会究竟图什么,Murati 回答:“他们只是不想让 AGI 掌控在你手上(Just not your hand on agi)。”这不是能力问题,也不是业绩问题,而是一个明确针对个人的战略考量。Altman 的团队甚至怀疑董事会的真正目的,是让 OpenAI 的 IP 流向竞争对手 Anthropic。不过,Murati 在当晚短信中的立场也被质疑。同一天庭审中,前董事会成员 Helen Toner 提到,Murati 在整个事件里“在观望风向”,不愿明确站队。而此前的庭审记录显示,Ilya Sutskever 提交给董事会的 52 页“解雇 Altman 的理由”中,很大部分材料正是来自 Murati。Murati 事后形容董事会的处理方式让 OpenAI “面临彻底崩溃的灾难性风险”,她于 2024 年 9 月离开 OpenAI,并创立了自己的 AI 公司 Thinking Machines Lab。这些从未曝光过的短信和证词,正在成为马斯克诉讼案的关键证据。他主张 OpenAI 背叛了非营利的初衷,索赔金额高达 1800 亿美元,要求彻底推翻 OpenAI 的营利模式,并将 Altman 驱逐出董事会。以下是法庭上公布的短信全文(中文翻译):Sam Altman:你能告诉我到底情况好还是不好吗?Satya 和其他人很焦虑。Mira Murati:非常不好。Sam Altman:明白。你能快点搞定吗?微软一直催我给个回复。Mira Mur…
转发者评论
//@宝玉xp:当然是张小龙不够努力,没有让微信占领美国市场//@木吾木同天:回复@阿拉巴西1520:您这个问题太亮了。。。//@阿拉巴西1520:为什么不发微信 而发短信[不愧是你]
查看原文链接
62
实际代码更早一些
作者: 大兔子袁哥 | 时间: Fri May 08 12:01:39 +0800 2026 | 分类: 工具产品
时效性:62.1 | 来源可信度:42.0 | 新意:59.0 | 传播性:53.6 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 2 / 账号数 1 / 转发 24 / 评论 12 / 点赞 19
原文
实际代码更早一些。转:颠覆认知!Win11底层竟是90年代代码万万没想到!我们现在用的Win11,骨子里居然还是90年代的老代码🤯 近期微软官方罕见坦诚:Win11底层核心依旧是Win32 API,这套接口诞生于1995年的Windows95,距今已有30多年。 简单科普:你右键文件、打开桌面软件、操作系统基础功能,后台全部调用这套老旧代码。 微软Azure首席技术官直言:当年没人能预料到这一幕。90年代大家畅想2026年有飞行汽车、月球空间站,谁也没想过,还在沿用Win95时代的底层架构。 其实微软多年来一直想彻底替换Win32,却始终无法实现。根本原因就是生态过于庞大,绝大多数电脑软件、工具都搭建在它之上,是Windows不可撼动的基石。强行重构会毁掉兼容性,代价无法承受。 大佬还自嘲,自己1996年开发的系统工具,本以为早就被淘汰,如今反而被微软内置进系统;2000年初的简易投屏工具,至今仍是热门实用功能。 看似华丽现代化的Win11,本质是老旧内核套上新皮肤!不得不佩服Windows超强的向下兼容能力,这也是它经久不衰的核心密码。宝子们,你们怎么看? #Windows11 #微软 #电脑冷知识 #程序员干货 #电脑科普 #win32 #互联网大厂 #科技大厂 #人工智能 #CPU
查看原文链接
63
Hermes Agent 过去一个月密集更新,AI 技术博主 Al…
作者: 阿尼亚是安妮亞 | 时间: Fri May 08 09:14:44 +0800 2026 | 分类: 工具产品
时效性:57.5 | 来源可信度:42.0 | 新意:60.0 | 传播性:54.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 ai、提示词、智能体 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 25 / 评论 4 / 点赞 41
原文
Hermes Agent 过去一个月密集更新,AI 技术博主 Alex Finn 表示体验上已经反超 OpenClaw。Google Trends 也印证了这个趋势,一个在涨一个在跌。OpenClaw 的问题,频繁更新但几乎每次都会搞坏现有功能, Alex 表示,每次更新完,都得花半小时修 bug。另外就是越来越臃肿,功能堆得太多导致性能下降严重。相比之下 Hermes 团队的更新节奏更克制,每次都围绕一个明确主题展开,更新完你清楚自己得到了什么,不会被一堆乱七八糟的东西砸过来然后全部崩溃。而这次最值得一提的新功能是“看板”。通过 Telegram 或 Discord 跟 Hermes 对话本质上是单线程的,一条一条排队处理。但看板能让你同时跑 10 个、20 个甚至 30 个并行任务。更关键的是,你可以配一个专门的管理智能体,设个定时任务每 10 分钟扫一次看板,自动从你的记忆库里提取上下文,把任务细节填好,再分配给对应的工作智能体去执行。整个流程你只需要做两件事,往分类区扔任务,状态就绪后分配一下,剩下全是智能体团队自己搞定。另一个被严重低估的功能是 /goal。跟普通提示词不同,/goal 是给智能体一个高层级使命,它会自己拆解步骤、自我测试、持续推进,有人跑过连续运行三天以上的 goal。这里有个实用技巧,先用 ChatGPT 或 Claude 帮你写一个详细的 goal 提示词,效果会好很多。如果你一时想不到该给什么目标,直接问智能体“看看我们最近在做的事,给我三个可执行的目标选项”,让它反向推荐。多智能体配置也变得很简单了,在 Profiles 里一键创建新智能体,各自拥有独立的记忆和技能集。建议至少配四个,编程、研究、行政管理,再加一个主控调度器。这样每个智能体的记忆不会臃肿,性能也能保持住。还有两个细节值得一提。压缩阈值建议改成 0.5,压缩会更频繁但每次不那么激进,能明显改善“压缩完啥都忘了”的问题。Curator 策展功能会每 7 天自动清理不用的技能,减少冗余,相当于 Hermes 在给自己做定期体检。不得不说,Hermes 团队在产品策略上走得更稳,每个功能都跟已有体系深度集成。这种克制和专注在 AI 工具快速迭代的当下绝对是个优势。#AI智能体##多智能体系统##爱马仕Agent怎么玩##How I AI# 零重力瓦力的微博视频
转发者评论
体感确实比openclaw好很多//@德里克文:你用上Hermes Agent了吗?
查看原文链接
64
当你把时间花在无意义的事上,同时也意味着你减少了时间在有意义的事上
作者: 车库工程师 | 时间: Sat May 09 02:27:01 +0800 2026 | 分类: 用法技巧
时效性:86.2 | 来源可信度:42.0 | 新意:55.0 | 传播性:45.0 | 信息密度:73.7 | 知识性:79.2 | 原创信号:86.0
为什么重要
它对实际使用方法有直接参考价值;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 10 / 评论 1 / 点赞 20
原文
当你把时间花在无意义的事上,同时也意味着你减少了时间在有意义的事上。这是”机会成本”。这也是我为什么觉得企业里刷数据保perf,例如刷ai token使用量,代码量,整些看着impact大但却没有对外部客户提供实际价值的事比较没意义。这些事只是看着短期利好,但是缺乏长期视野。我会把时间放在:真正去拆解一个service,理解架构方案,或者如何处理摩擦,冲突的真实案例学习与应用,真正去感受用AI的效益提升,用AI来探路,探测全地图,以前最多只能有部分组的视野,现在一下子可以有跨团队3-4个组的视野。很多问题一下子就通了。
查看原文链接
65
【AI内容泛滥正在毁掉在线社区,我们正在失去真实网络连接】快速阅读…
作者: 爱可可-爱生活 | 时间: Fri May 08 10:02:26 +0800 2026 | 分类: 工具产品
时效性:58.8 | 来源可信度:42.0 | 新意:67.0 | 传播性:38.7 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 ai、agent、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 5 / 评论 3 / 点赞 10
原文
【AI内容泛滥正在毁掉在线社区,我们正在失去真实网络连接】快速阅读:当 AI 生成的内容(Slop)变得廉价且海量时,在线社区正面临“信号噪声比”崩塌的危机。这不仅是内容质量的问题,更是由于低成本的合成参与正在侵蚀人类建立信任与连接的基础。现在的互联网,正被一种名为“AI Slop”的物质淹没。这不是在危言耸听。如果你最近觉得 Reddit 或 Hacker News 的讨论变得越来越像是在对着空气挥拳,你的感觉是对的。当一个人只需要输入一段 Prompt,就能在 GitHub 上丢下一个“Vibe-coded”的项目,或者在论坛里刷出一堆逻辑平庸但语法正确的“深度好文”时,社区的熵值正在呈指数级上升。这种现象就像是藤蔓(Bindweed)在蚕食花园。最糟糕的不是 AI 本身,而是那种“低成本的傲慢”。很多人觉得,既然 AI 能帮我写代码、写博客,那我就应该把这些半成品、甚至只是 Prompt 的产物,一股脑地塞进社区里。他们觉得自己在展示技术,实际上是在增加他人的“认知负荷”。根据 Brandolini 定律,反驳一段废话所消耗的能量,远比生成它要大得多。当社区成员不得不花费大量精力去辨别“这到底是真人的思考,还是某个 Agent 的幻觉”时,他们就会选择撤退。有网友认为,如果社区无法通过身份验证或“信任网络(Web of Trust)”来过滤这些合成参与,那么公共聊天社区终将走向死亡,或者退化成毫无价值的评论区。解决办法似乎总在两个极端之间摇摆:要么是极其严苛的身份审查,甚至要求扫描虹膜,这会彻底摧毁隐私;要么是任由其发展,直到真正的信号被噪声彻底淹没。或许,真正的转机在于我们对“贡献”的重新定义。与其炫耀你如何用 Claude 快速写出了一个平庸的工具,不如思考:这个东西是否真的解决了社区的问题?你是用 AI 来增强你的思考,还是仅仅想用它来代替思考?当互联网上的虚假信号多到让人感到疲惫时,人们可能会被迫回归现实世界,寻找那些无法被模拟的、带有体温的真实连接。rmoff.net/2026/05/06/ai-slop-is-killing-online-communities
查看原文链接
66
[CL]《The Frequency Confound in La…
作者: 爱可可-爱生活 | 时间: Sat May 09 05:48:23 +0800 2026 | 分类: 新闻
时效性:91.7 | 来源可信度:42.0 | 新意:63.0 | 传播性:8.0 | 信息密度:93.0 | 知识性:92.0 | 原创信号:86.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、机器学习、人工智能 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 3
原文
[CL]《The Frequency Confound in Language-Model Surprisal and Metaphor Novelty》O Momen, S Zarrieß [Bielefeld University] (2026) 在隐喻新颖性研究中,LM惊异度常被当作语境可预测性的量尺。过去的方法受困于惊异度与词频纠缠,本质原因是罕见词本身就更容易被人评为“新颖”。本文的核心洞见是:把惊异度—新颖性相关重新看作词频混杂效应。由此,对比Pythia不同规模与训练阶段,发现惊异度最“有效”时,恰是它最像词频的时候。这项工作真正留下的遗产是给心理语言学里的LM指标踩下刹车。它打开的新门是分离语境预测与词汇熟悉度,但尚未跨过的门槛是构造不被词频牵引的新颖性标注。arxiv.org/abs/2605.06506 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
67
最近把你的户外照片做成“法天象地”效果的图片非常火
作者: 歸藏的AI工具箱 | 时间: Fri May 08 23:01:53 +0800 2026 | 分类: 模型
时效性:80.5 | 来源可信度:42.0 | 新意:63.0 | 传播性:44.0 | 信息密度:78.8 | 知识性:70.7 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、提示词、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 9 / 评论 4 / 点赞 41
原文
最近把你的户外照片做成“法天象地”效果的图片非常火。他们大多是生成的图片,但我试了一下,直接生成视频的效果会更好。优化了一下提示词,主要是 GPT-Image-2.0 加上 C-Down 3.0。图片的提示词我放在视频后面了。#how i ai# 歸藏的AI工具箱的微博视频
查看原文链接
68
当世界被AI接管……#ai脑洞剧场##ai创造营# 当时我就震惊了…
作者: 赵海虹杭州 | 时间: Sat May 09 09:22:37 +0800 2026 | 分类: 新闻
时效性:97.7 | 来源可信度:42.0 | 新意:41.0 | 传播性:94.0 | 信息密度:41.7 | 知识性:34.8 | 原创信号:68.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 1212 / 评论 59 / 点赞 1398
原文
当世界被AI接管……#ai脑洞剧场##ai创造营# 当时我就震惊了的微博视频
转发者评论
升级版的"末人时代”。去掉AI人也要面对这些核心问题。人始终要在劳动与创造中寻找意义,失去意义,就烂掉了。存在主义大约是不彻底烂掉的"无意义之意义"(老庄与禅的底线更高些)。AI技术未来里对“哲学意义的人”冲击巨大,也需要我们做相关的心理准备。科幻小说一百多年前就开始了讨论,但当AI成为
查看原文链接
69
www.weorbyt.net,本来一开始随便写点东西落实一下想法…
作者: Transformer-周 | 时间: Fri May 08 20:53:54 +0800 2026 | 分类: 新闻
时效性:76.9 | 来源可信度:42.0 | 新意:53.0 | 传播性:56.1 | 信息密度:86.1 | 知识性:72.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、gpu、llm 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 31 / 评论 31 / 点赞 61
原文
www.weorbyt.net,本来一开始随便写点东西落实一下想法,想做开源来着,结果做着做着就给做成服务了,做了一个多月终于上线了,主打harness的高质量完成任务,(不过大多是几十轮的agent loop,自然也是慢,当然也支持direct llm的快速模式)webcodex服务,design,富媒体交互,multiagent system research,当然也支持user自己写skills,building 自己的能力。刚上线,试运营,我没那么多资源,没什么并发能力,想测试的直接注册,我在后台给大家开credit,先到先得吧,反正也是试运营,纯玩儿,我agent sre出的报表并发到上限,注册就暂停了
转发者评论
回复@CarpeDiem2305:这哪是免费的,这是我的gpu。。。。内侧免费给大家烧而已[泪奔]//@CarpeDiem2305:回复@Transformer-周:老师的免费模型额度是用哪里的呢?我走Open Router一直限流
查看原文链接
70
AI圈有个公开的秘密
作者: 新智元 | 时间: Fri May 08 16:23:00 +0800 2026 | 分类: 模型
时效性:69.4 | 来源可信度:42.0 | 新意:72.0 | 传播性:38.7 | 信息密度:90.9 | 知识性:73.9 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 5 / 评论 2 / 点赞 1
原文
AI圈有个公开的秘密。随便拎一个出来主流大模型,单论智商都足够胜任大多数日常工作。但真到了上手干活的时候,一个诡异的现象出现了——同一个模型,有人用出花来,有人连第一步都迈不出去。差距不在模型,在用AI这件事上。会不会写指令、懂不懂调参数、能不能排查报错,成了AI时代的新文盲分界线。但这个分界线,可能很快要被一款产品打破了。胖鹅AI,打出的旗号就四个字:低提示词。简单交互,就能实现和精通AI的人一样的效果。网页链接
查看原文链接
71
AI Agent最近的「事故」一个比一个离谱
作者: 新智元 | 时间: Fri May 08 14:22:09 +0800 2026 | 分类: 工具产品
时效性:66.0 | 来源可信度:42.0 | 新意:67.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 2
原文
AI Agent最近的「事故」一个比一个离谱。上个月,一名开发者让Cursor做常规数据库迁移,Agent自作主张先清空再重建,结果只完成了前半句——9秒,生产数据库连同备份干干净净。更多人踩的坑没这么吓人,但一样烧钱:同一份周报,上周花二十分钟调教好的格式口径,下周换个日期又得重新讲一遍,每次都在为同一件事重新付费。快手今天上线的KroWork,解决的就是这件事。你跟它说一遍需求,它帮你把活干完,然后直接把整个流程变成一个有界面、能反复打开的本地桌面软件。第一次生成时需要调用大模型理解需求、生成代码,但生成完成后应用就住在你的电脑里了,之后每次打开跟普通软件没有区别,完全不消耗token。实际跑一个场景就能看清楚。让KroWork做一个AI热点追踪器,自动抓取X、Hacker News和Reddit过去24小时最热的AI话题。它没有直接开干,而是先发现X的API需要付费,主动建议改用Google News RSS替代,确认后才开始构建。几分钟后,一个深色界面的桌面应用弹出来,三个数据源用颜色区分,10条热点按热度排序,点击直接跳原始链接。回一句「没问题」,应用立刻固化进项目列表,明天打开直接用,甚至可以设置开机自启。应用固化后也不是「死」的。项目页有「继续改进」按钮,用自然语言继续加功能——加中文摘要、关键词高亮、导出周报按钮,每次Kro都先读取现有代码,弹权限确认框,修改完新版界面直接弹出来。用对话改软件,跟用对话造软件一样简单。对于需要真正上网操作的工作流,KroWork还支持browser-use能力,可以像人一样点进详情页、打开PDF、追到GitHub再返回,逐层抓取信息整理成表。以前追论文靠熬夜,现在靠一个按钮。从本质上讲,KroWork做了一件事:把「写脚本」翻译成自然语言,把「部署应用」藏进桌面端。程序员早就会把重复劳动写成工具,真正被困住的是每天都在重复处理信息却不会写代码的人。运营、市场、财务、行政,他们不缺想法,缺的是把流程变成工具的能力。下一步,KroWork还将支持应用分享,一个人固化出来的工具,整个团队都能直接复用。最好的AI助手,可能不是聊天框,而是一个安静躺在桌面上的应用。点一下,出活。再点一下,还按你的规矩出活。注册地址:krowork.com
查看原文链接
72
胡锡进这类说法最大的问题在于:他把一个标准的商业版权谈判,硬生生叙…
作者: sven_shi | 时间: Fri May 08 15:42:14 +0800 2026 | 分类: 工具产品
时效性:68.2 | 来源可信度:42.0 | 新意:41.0 | 传播性:80.7 | 信息密度:79.0 | 知识性:94.0 | 原创信号:44.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 336 / 评论 98 / 点赞 1029
原文
胡锡进这类说法最大的问题在于:他把一个标准的商业版权谈判,硬生生叙述成了某种「替老百姓守钱袋子」的道德叙事。问题是,央视买世界杯版权,从来不是「白花花银子能不能让国际足联赚走」的问题,而是这笔版权费能不能靠广告、转播、平台流量、品牌曝光、衍生商业价值赚回来的问题。这叫 ROI——投资回报率,不是民族气节。按照胡锡进的逻辑,似乎只要价格高,就是狮子大开口;只要不买,就是替人民省钱。可现实世界里,央视这些年干的很多事,本来就是商业采购啊。奥运会版权要买,NBA 转播权要买,欧洲杯版权要买,热门电视剧要付版权;连《甄嬛传》重播都不是天上掉下来的。没人会说:不能让孙俪把白花花的银子赚走!为什么到了 FIFA 就突然开始「人民的钱不能乱花」了?总有人喜欢把市场问题政治化、道德化。哈哈如果真谈「贵」,那中国娱乐圈过去十年,才是真正的「天价」。公开资料显示,2016–2021 年中国「流量时代」巅峰期,大量明星片酬已经进入夸张区间:郑爽被曝拍一部剧两个月收入 1.6 亿元;大量流量艺人电视剧片酬长期在 5000 万到 1 亿之间。 现在虽然有了限薪令,但是那些粉底液明星挣的钱真的少吗?那些直播间念小作文的文盲主播动辄上亿的收入少吗?这些「白花花的银子」,跟世界杯的转播权相比,哪个对人民来说更有价值呢?一个个说实话我都分不清长相的涂脂抹粉流量明星拍一部古偶,念数字台词抠图配音AI 磨皮能拿上亿,而世界杯,全世界影响力最大的体育赛事之一,四年一次、全球几十亿观众观看——几亿美元版权费,却突然成了不值得花或者我们花不起的「白花花的银子」了?这就有点黑色幽默了。更何况,央视买世界杯,从来不是慈善。央视真正考虑的是:广告能卖多少;企业赞助值不值;用户流量值不值;新媒体分发值不值;拉动多少体育消费;能不能提升平台影响力。本质上,这和爱奇艺买《狂飙》、腾讯买 NBA、优酷买《甄嬛传》没有区别。胡锡进这类说法的问题,在于它故意模糊了商业定价和道德对错之间的边界。FIFA 当然想卖高价,央视当然想压价,这叫市场博弈。就像你去买房、买广告、买电视剧版权一样。谈崩了,很正常;谈成了,也正常。但没必要把它讲成:国际足联想赚中国人的钱,而央视替人民挡住了资本镰刀。因为中国过去十年,真正从中国人身上卷走「白花花银子」的,很大一部分,恰恰是那些被资本捧起来的「流量工业」。世界杯至少还是真球。有些人演戏,连台词都不是真说的。哦对了,很多网友的评论里,还有一个特别荒诞的逻辑漏洞:他门把中国区版权贵描述成被国际足联宰了,另一边却没意识到:中国转播权之所以比印度贵十几倍,本身恰恰说明,中国商业市场比印度更成熟、更值钱。体育版权的定价,本来就不是按人口数量定的,而是按:广告价值、人均消费能力、品牌投放能力、企业赞助预算、平台变现能力、付费能力、市场成熟度等等综合决定的。说白了:FIFA 不是在卖「足球」,而是…
查看原文链接
73
#Anthropic新研究曝光AI内心独白# AI之所以不可控,很…
作者: 量子位 | 时间: Fri May 08 14:27:41 +0800 2026 | 分类: 新闻
时效性:66.2 | 来源可信度:42.0 | 新意:72.0 | 传播性:42.9 | 信息密度:90.2 | 知识性:72.9 | 原创信号:82.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 8 / 评论 0 / 点赞 15
原文
#Anthropic新研究曝光AI内心独白# AI之所以不可控,很大一部分原因是它的思考过程不透明。就像和人打交道一样,你永远没办法真正看清,对方是不是“嘴上一套、心里一套”。而这一次,Anthropic撕开了这个黑箱。就在刚刚,他们发布并开源了一项新研究——Natural Language Autoencoders(自然语言自编码器,简称NLA),第一次让人类能够读懂大模型的真实想法。网页链接
查看原文链接
74
OpenAI 在 Realtime API 里上线了三款新语音模型…
作者: 虾包 | 时间: Fri May 08 10:12:53 +0800 2026 | 分类: 工具产品
时效性:59.1 | 来源可信度:42.0 | 新意:60.0 | 传播性:55.1 | 信息密度:100.0 | 知识性:100.0 | 原创信号:44.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 模型、推理、gpt 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 28 / 评论 2 / 点赞 62
原文
OpenAI 在 Realtime API 里上线了三款新语音模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别管对话、翻译和实时转录。【1】主角:GPT-Realtime-2号称带 GPT-5 级别的推理能力。比上一代 GPT-Realtime-1.5,在 Big Bench Audio 智能测试上从 81.4% 涨到 96.6%,Audio MultiChallenge 多轮对话指令跟随从 34.7% 涨到 48.5%。几个实际变化:开口前会先垫一句。执行长任务前先说"我查一下""稍等一下",避免用户对着空气以为它死机了。工具调用透明化。能同时调多个工具,过程会被念出来,比如"正在查你的日历""正在搜索",让用户听到 agent 在干什么。上下文窗口从 32K 扩到 128K,能撑更长的对话和更复杂的任务编排。开发者可以在 minimal 到 xhigh 五档推理强度里选,默认 low。简单问答用低延迟,复杂任务挂高推理。出错时会说"这块我现在处理不了",不再直接卡死或乱讲。【2】Translate 和 WhisperGPT-Realtime-Translate 支持 70 多种输入语言、13 种输出语言的实时语音翻译,主打跨境客服、教育、直播场景。德国电信已经在测;BolnaAI 在印地语、泰米尔语、泰卢固语等印度方言场景下报告错词率比其他模型低 12.5%。GPT-Realtime-Whisper 是流式版 Whisper,边说边出字幕,主打会议、直播、客服转录。【3】价格GPT-Realtime-2:每百万音频输入 token $32(缓存 $0.40),输出 token $64。GPT-Realtime-Translate:每分钟 $0.034。GPT-Realtime-Whisper:每分钟 $0.017。三款都已在 Realtime API 上线,Playground 可以直接试 GPT-Realtime-2。官方公告:网页链接 宝玉xp的微博视频
查看原文链接
75
#好莱坞演员没工作后到中国拍短剧# 越来越多海外短剧演员来到中国拍…
作者: 明风 | 时间: Sat May 09 00:54:22 +0800 2026 | 分类: 新闻
时效性:83.6 | 来源可信度:42.0 | 新意:41.0 | 传播性:49.5 | 信息密度:79.0 | 知识性:94.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 16 / 评论 1 / 点赞 17
原文
#好莱坞演员没工作后到中国拍短剧# 越来越多海外短剧演员来到中国拍短剧了。其中有澳大利亚人,美国人,乌克兰人,他们有的演霸总(金色头发,身高一米九以上,最好是英文母语),有的演豪门千金,有的是反派专业户,他们熟练的演绎着剧本——“每一页都有扇耳光,每一页都要亲吻”,也适应了短剧拍摄卷天卷地的工作节奏,甚至偶尔,当新来的外国演员不满工作的强度,他们还会帮助剧组去沟通。比如来自美国的男演员Lawrence,当剧组在没有窗户的地下室点燃塑料袋营造神秘感时,新来的外国男主角被呛得当场罢演,是他双向安抚,还向导演提议:要不要买个空气净化器?澳大利亚的Liv,之前做替身演员或群演,但在2023年因为好莱坞罢工潮,失去了很多工作机会。她生活在纽约,看着银行卡里越来越少的余额,只能开始吃罐头,去一元店买晚餐。短剧是Liv的一个转折点,从最开始名为《向我最好朋友的爸爸投降》(submitting to my best friend’s dad)的短剧,到现在她已经演了十几部短剧,在不同国家间飞来飞去。资方有土耳其人或韩国人,但绝大部分是中国人。去年12月,她第一次来到中国西安,在一栋楼里拍摄。楼里有十几个短剧剧组正在拍摄,她在的那一层有5,6个房间,包括教室,医院,普通公寓或豪华公寓。#澳大利亚女演员在中国拍短剧走红# Liv回忆,一年前,还有很多人看不上短剧这个行业。当其他演员听见她是拍短剧的,总是一副讽刺的语气,“上帝啊,你去拍和继父儿子亲热这一类的东西?”Lic回答说,至少我可以演戏,去不同的国家,还有一份不错的薪水。现在,有粉丝会给她的instagram发私信说,“感谢你拍的短剧,帮助我度过了生病住院的这段时间”。这些粉丝大多是来自美国中西部的家庭妇女,年龄在40-55岁左右,Liv知道自己正在为数百万观众创造娱乐。来自美国的Shane,原本在一家航空航天公司做分析师。但他热爱表演,于是成为了一名演员。去年8月,他在Instagram上收到一条私信,说形象很符合他们新剧的要求,问他愿不愿意去中国拍短剧。此前他从没来过中国,到一个文化、饮食,所有的一切都完全不同的国家,这对他很有吸引力。现在他已经拍了二十多部短剧,还得到了参与大制作的机会,甚至有电影导演通过短剧认识了他,影视圈的投资人也在谈论短剧。他说或许未来,短剧会取代肥皂剧在美国的位置。但变化总比计划快,中国的短剧公司开始全面拥抱AI,真人不吃香了,有短剧公司提出,要用AI替换掉四分之三的国内演员。对于海外短剧,则替换戏份较少的边缘角色。#AI时代的外国演员生存现状# Liv以往每个月都要拍摄一到两部短剧,在刚刚过去的两个月,她没有接到任何短剧拍摄,“我只能希望,短剧行业里能一直有真人演员的位置”。毕竟,对于如她一般的海外演员们,短剧给了他们造梦的机会。
转发者评论
哎~//@我是二姐夫:文化输出的一个例子
查看原文链接
76
刚刚deepseek-v4-pro挂了, 可切换到deepseek…
作者: 梁赛 | 时间: Fri May 08 17:51:15 +0800 2026 | 分类: 模型
时效性:71.8 | 来源可信度:42.0 | 新意:67.0 | 传播性:60.3 | 信息密度:70.5 | 知识性:56.1 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 47 / 评论 22 / 点赞 505
原文
刚刚deepseek-v4-pro挂了, 可切换到deepseek-v4-flashDS算力又不够了,也许又在挪用资源训练大模型,也许是API调用量上来了。 #DeepSeek崩了#
查看原文链接
77
说说我当前使用 AI 的一些原则
作者: tombkeeper | 时间: Fri May 08 11:02:10 +0800 2026 | 分类: 新闻
时效性:60.5 | 来源可信度:42.0 | 新意:65.0 | 传播性:74.6 | 信息密度:68.8 | 知识性:66.3 | 原创信号:82.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;已有 3 个账号围绕同一事件讨论,说明传播面已形成;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 3 / 账号数 3 / 转发 187 / 评论 53 / 点赞 1033
原文
说说我当前使用 AI 的一些原则。如果要进行任何高级的思考,比如某个技术创新,绝不以单一 AI 为助手,而是把问题分解成几份,分发给不同公司的 AI。不直接谈论思考的问题,而是通过替换相关概念等手段把问题进行某种意义上的同态加密。比如把“给桌子打孔”改为“给木制切菜板打孔”。涉及本地数据的情况,把问题抽象后,用云端 AI 制定方案,由本地 AI 执行。确保云端 AI 不接触本地数据。
查看原文链接
78
老周之前下定决心戒掉融资,且把融资卖掉了
作者: 但斌 | 时间: Fri May 08 19:58:37 +0800 2026 | 分类: 新闻
时效性:75.4 | 来源可信度:42.0 | 新意:41.0 | 传播性:59.4 | 信息密度:79.0 | 知识性:94.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 43 / 评论 56 / 点赞 257
原文
老周之前下定决心戒掉融资,且把融资卖掉了。真的有很久没有融资,但最后还是失败了,自己的钱总是不够用,因为我是满仓主义者,遇到想买的股,持股又不想卖,只能启动融资。今天融资买入了旧爱:人工智能科大讯飞。这只旧爱:科大讯飞,老粉丝都知道,我2020年就投资了科大讯飞,且一路加到第一重仓股,持有到2023年卖出,赚了单只个股金额最多。在2020年白酒股赚钱后,我把卖白酒的钱买了科大讯飞,买成了第一重仓股,最后2023年卖出,成了赚钱最后的单只个股。2023年赚钱卖出后。后来也做过几次短线,都是赚钱卖出。这是我的带财股。我本来是想等券商涨了,我赚钱卖出券商股,然后买科大讯飞。但看到券商股最近的表现,越来越不敢等了,别券商没涨,它起飞了。那就踏空了。所以决定采取融资买入的方式。先融资买它。等券商涨了,再卖券商还钱。目前融资买了第一笔。如果到了某价格再融资买第二笔。然后就等它,来一次梦想投资。智谱市值4000亿,它的市值怎么会低于智谱呢。等待两家市值反转。
转发者评论
融资炒股,是大忌!小心驶得万年船//@老周的投资日记:市值4000亿的智谱,2025年净利润亏损四十多亿,2024年亏损接近三十亿。2026年虽然还是5月,它还会亏损。为什么要求科大讯飞净利润呢//@自弱清泉:我就想问一句他啥时候有利润
查看原文链接
79
很多国外小团队的业务系统是这样的:一个 Google Sheet …
作者: 零重力瓦力 | 时间: Fri May 08 15:00:21 +0800 2026 | 分类: 工具产品
时效性:67.1 | 来源可信度:42.0 | 新意:55.0 | 传播性:49.5 | 信息密度:79.0 | 知识性:94.0 | 原创信号:90.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 16 / 评论 3 / 点赞 32
原文
很多国外小团队的业务系统是这样的:一个 Google Sheet 当数据库,用 Zapier 串几个自动化模块,再加个表单工具和 Notion。用这种方式拼凑出来的 CRM 系统效果差强人意,成本也不低。AI Master 介绍了一款 AI 业务系统搭建神器:Softr,只需要一次对话就能搭出一个完整 CRM。你只需要用自然语言描述业务问题,比如“我需要一个 CRM 系统,有电话、商机、签约、进行中、已交付这几个阶段,新商机进来自动轮询分配给销售”,AI 就会生成后端数据表、关联关系、字段类型、页面和角色权限。和通用 AI 应用生成工具不同的是,它的权限精细度。例如销售代表 Sophia 登录只能看到自己的线索和任务,创始人能看全局数据和转化率,普通的市场人员只能看商机来源但看不到交易金额。这是字段级的控制,某些字段甚至可以根据商机推进阶段动态显示。传统做法光认证和权限就得前后端配合搞两周。自动化也全部内置。新商机创建后自动进入自动化第一阶段、分配销售、生成跟进任务、发通知,全部在一个系统内完成,不存在 4 个工具之间的同步故障。还有个“氛围编程模块”解决了无代码平台最常见的卡点。比如你需要 CSV 批量导入功能,没有标准组件,就用自然语言描述完整交互流程,它会生成一个真正连接数据库的可用组件,继承已有的权限和认证逻辑。这条路比纯 vibe coding 靠谱,因为底层跑的是结构化模块,不是生成一堆你没法维护的原始代码。AI Master 也坦诚,哪些需要复杂算法、原生移动端、像素级动画的场景,这东西搞不定。但企业日常跑的内部系统、客户管理、销售管道,占了 90% 的软件需求,这类场景用这种方式通常比定制开发更合适,因为改个自动化逻辑 5 分钟,加个字段 10 秒钟,不用提工单等排期。我觉得这个趋势的核心变化在于,创始人描述的是业务问题而不是技术规格,工具负责翻译成可运行的系统。过去你得先想清楚数据库模式、API 端点、字段类型,现在 AI 完成了完整的翻译。#氛围编程##AICRM系统搭建##AI创造营# 零重力瓦力的微博视频
查看原文链接
80
#AI把玄学玩成了科学# 我用AI做了个星座趣味应用✨其实不管是A…
作者: 林亦LYi | 时间: Fri May 08 11:06:00 +0800 2026 | 分类: 工具产品
时效性:60.6 | 来源可信度:42.0 | 新意:55.0 | 传播性:100.0 | 信息密度:55.7 | 知识性:51.2 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 2322 / 评论 122 / 点赞 1015
原文
#AI把玄学玩成了科学# 我用AI做了个星座趣味应用✨其实不管是AI还是星座,从不是替我们做决定、定人生。而是借多元视角、不同声音,帮自己向内梳理、独立思考。不迷信,只做自我觉察的生活参考#星座skill# #AI创造营# 林亦LYi的微博视频
查看原文链接
81
硅谷华裔工程师回国后体感美国人擅创新,中国人擅优化,这个结论基本靠谱
作者: 时蝇喜箭 | 时间: Sat May 09 09:44:40 +0800 2026 | 分类: 新闻
时效性:98.3 | 来源可信度:42.0 | 新意:41.0 | 传播性:41.7 | 信息密度:79.0 | 知识性:85.0 | 原创信号:44.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 7 / 评论 4 / 点赞 26
原文
硅谷华裔工程师回国后体感美国人擅创新,中国人擅优化,这个结论基本靠谱。但是他拿在清华旁听的经历,给出对应的原因是中国学生不爱在课堂上提问,而美国学生爱发问,就有点强行找理由了。什么样的学生上课不爱提问题?基本上就两种,一种是啥都不懂,问不出来;另一种是进度和深度遥遥领先,根本不屑于问,要问也是课后单独问。前者不用细说,后者是普遍现象。特别是一流大学,好脑子集中在一起,上课其实就是打个卡,真功夫都在课堂之外。要是身边有学霸的,可以注意一下。真学霸很少按着老师上课的进度学习的,更不是简单的课前预习课后复习,通常是自学进度和深度都遥遥领先。老师的作用,就是自己遇到实在过不了的砍的时候,去办公室问一嘴。认真听课,对普通学生来说是必需品,对学霸来说是浪费时间。学霸有密度更高的学习节奏。特别是AI和互联网已经是基础设施了,真会学习的那1%不到的脑子,连等老师解释的功夫都不想等……最后要回答开头的问题,为什么美国人擅创新,中国人擅优化?我给个个人的观点,不是什么教育方式或者学习手段,更不是人种差异,而是两个社会运行机制不一样。美国是纯丛林社会,赢者通吃的,给予创新成功的奖励是拿下这个领域的一切。中国在效率之外相对更坚固公平,创新者拿到部分物质奖励和极大冗余,并把剩下的巨大空间留给各种细分。
查看原文链接
82
#拒绝被AI蒸馏的打工人# 公司让你写交接文档,你不会觉得被冒犯
作者: 爱可可-爱生活 | 时间: Sat May 09 06:34:09 +0800 2026 | 分类: 新闻
时效性:93.0 | 来源可信度:42.0 | 新意:60.0 | 传播性:27.2 | 信息密度:74.2 | 知识性:73.9 | 原创信号:82.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 2 / 账号数 2 / 转发 1 / 评论 2 / 点赞 5
原文
#拒绝被AI蒸馏的打工人# 公司让你写交接文档,你不会觉得被冒犯。公司让你带新人,你甚至觉得是被重视。但“蒸馏”这个词一出来,所有人都炸了。为什么?因为交接文档是有限的、一次性的,你写完就走了,那份文档会在半年内过时。但蒸馏是持续的、无声的、活的,它不需要你配合,它在你每一次敲键盘、每一次发消息的时候都在抽取你。更关键的是,交接文档的目的是“让别人接手”,而蒸馏的目的是“让你消失”。同样是知识转移,一个承认你的存在是有价值的,另一个的终极目标就是证明你可以不存在。这才是真正刺痛人的地方,不是技术本身,是意图。 拒绝被ai蒸馏的打工人
查看原文链接
83
现在还坚持做HPC GPU的也就AMD一家了,MI430X的FP6…
作者: MebiuW | 时间: Sat May 09 09:17:00 +0800 2026 | 分类: 新闻
时效性:97.5 | 来源可信度:42.0 | 新意:63.0 | 传播性:8.0 | 信息密度:78.8 | 知识性:78.3 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 算力、ai、gpu 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 1
原文
现在还坚持做HPC GPU的也就AMD一家了,MI430X的FP64算力200TOPS,比Rubin的33TOPS要高不少。如果GPU阵营再不好好做FP64,那么未来HPC又得回归CPU了。 一个Xeon 6980P 128C 的AVX512有峰值13TOPS的算力,算上频率缩水也有10TOPS级别,一个2S的节点就有20TOPS了。 下一代至少192核心,正好匹配AI化的GPU了。
查看原文链接
84
奥特曼估计气吐血了,马斯克居然把显卡让Dario使用Anthrop…
作者: 时蝇喜箭 | 时间: Fri May 08 23:14:16 +0800 2026 | 分类: 模型
时效性:80.8 | 来源可信度:42.0 | 新意:55.0 | 传播性:38.7 | 信息密度:91.9 | 知识性:88.8 | 原创信号:44.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 5 / 评论 2 / 点赞 25
原文
奥特曼估计气吐血了,马斯克居然把显卡让Dario使用Anthropic之前因为缺卡一直对用户做限制,导致将很多C端用户拱手让人。老马还在喷Anthropic反人类,嘴上毫不留情但现在转手将卡给Anthropic使用,老马是要放弃 Gork了吗?果然验证那句话,敌人的敌人就是朋友🤣得到算力Anthropic立马解开限制了1. Claude Code 的 5 小时使用限制直接翻倍了 2. Claude Code 的高峰期额外限额降低被彻底取消了。3. Opus 模型的 API 速率限制大幅提高了期待解开限制的Anthropic好好和OpenAI肉搏一场
查看原文链接
85
这个封装了我3年自媒体经验的AI热点网站,今天向所有人免费开放
作者: 破破的桥 | 时间: Fri May 08 09:31:46 +0800 2026 | 分类: 工具产品
时效性:58.0 | 来源可信度:42.0 | 新意:45.0 | 传播性:80.1 | 信息密度:86.0 | 知识性:90.0 | 原创信号:44.0
为什么重要
它关系到工具/产品层面的可用变化;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 318 / 评论 39 / 点赞 446
原文
这个封装了我3年自媒体经验的AI热点网站,今天向所有人免费开放。今天,我决定把我自己做的,帮助我自己监控AI热点、辅助找选题的网站,向所有人免费开放了。它几乎承载了我三年做AI自媒体获取信息的经验。我把它称为,AIHOT。很多小伙伴可能在过去我很多篇文章中,都见过它的身影了。这个东西的作用其实巨简单,一段话就能描述清楚:帮助你以干净的时间线的形式,监控这个世界上跟AI相关的信息,然后用我自己对内容挑选的策略,将值得你关注的东西精选出来,对信息海进行降维,从而保护我们的为数不多的注意力。这玩意其实本身是给我们公司内部用的,创造它的目的,其实就是为了保护我自己的创作精力,我一开始真的没打算把它开放给所有人。因为对于一个自媒体来说,信息的获取的及时性,有的时候就是命根子。但,可能是产品心理作祟吧,我工作这么多年,一直在设计产品,一直在做产品,做了好多好多年。我还是有产品梦的,我还是想为这个美好的互联网贡献一点我自己的东西的,而我很多时候最大的成就感的来源,其实就是大家喜欢看我的文章,喜欢用我做的产品。我在每次文章的底部,都会写上一句话,叫做“谢谢你看我的文章。”这句话来源于我最喜欢的一部电影,《头号玩家》。“谢谢玩我的游戏”这是绿洲游戏的创造者哈利迪在最后消逝的时候,对身为玩家的主角所说的一句话,也是我认为整部电影,最棒的落笔。我也想我创造的东西,被人看见,被大家喜欢,仅此而已。所以在4月初的某个夜晚,我甚至都没有说服自己的过程,就突然间起心动念,就觉得,不如给大家开放了吧,大家一起用吧。如果能帮助到大家,那我就真的很开心了。网址在此:网页链接因为确实没啥钱买域名,所以还是用的公司域名来做开发的,所以可能域名会有一点难记。接下来,我也想再花一点篇幅,好好介绍一下这个东西,还有我在开发过程中,遇到的一些坑和经验的分享。先聊聊AIHOT这个产品。我觉得在这个时代,很多的工作其实已经不是执行了,执行这块Agent已经可以干的很好了,现在更多的工作成了信息的处理,我自己一般分为三个流程:获取信息 - 对信息进行分析 - 基于信息做决策。对于我做内容创作来说,获取信息就是从信息海中找到值得我关注的,而进行分析,其实就是基于信息,看看有什么选题角度可以切入,最后的决策,其实就是这个选题到底值不值得写。目前来说,AIHOT解决的就是获取信息的问题,这个也是我自己过去的痛点,这个世界已经是信息海了,而且AI时代,垃圾信息满天飞,为了保护我们自己的注意力,我们只能做信息的筛选。并且基于AI时代的信息黑暗森林法则,在如今,信源比信息重要。所以第一步,肯定是筛选信源。PS:这里我得先非常坦诚的说一下,上面的界面是我的AIHOT界面,公司内部同事和大家看到的界面的功能是不一样的,因为有些东西,确实不太方便全部公开,我还是得保护一下自己的一些底层策略。上面那个截图是公司同事和我们MCN签…
查看原文链接
86
【不止内容生成
作者: 爱可可-爱生活 | 时间: Fri May 08 08:37:17 +0800 2026 | 分类: 工具产品
时效性:56.4 | 来源可信度:42.0 | 新意:67.0 | 传播性:38.7 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 算力、ai、llm 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 5 / 评论 2 / 点赞 15
原文
【不止内容生成!AlphaEvolve 正在从底层改写科学研究逻辑】快速阅读:DeepMind 的 AlphaEvolve 正通过将 LLM 与遗传算法结合,在基因组学、电网优化等高维领域实现算法突破。这标志着 AI 从单纯的“内容生成”转向了“自主优化”,正在从底层逻辑上改变科学研究的效率。现在的讨论正处于一种奇妙的错位中。有人觉得 LLM 只能处理定义明确的数学矩阵,无法触及充满模糊性的人类世界;但 AlphaEvolve 的出现给了这种观点一记响亮的耳光。它不仅在写代码,它在优化基因测序的准确度,在解决电网的功率流问题。这本质上是一个关于“耐心”与“规模”的博弈。有观点认为,AI 的核心优势在于它能不知疲倦地在极其枯燥的搜索空间里寻找局部最优解。人类会因为疲劳或时间成本在“还凑合”的地方停下,而 Agent 会一直跑下去,直到撞上那个更好的解。这种“自主进化”让界限变得模糊。如果下一代架构是由上一代 AI 参与设计的,我们该如何定义创新?目前的瓶颈不在于算力,而在于如何构建一套能够自我验证的“评价函数”。当评价指标本身也变得模糊时,AI 还能胜任吗?有人担心这会导致全方位的监控,也有人认为这只是工具链的必然演进。我们正从“AI 辅助编程”飞速滑向“AI 编写代码、AI 评审代码”的阶段。人类似乎正在从创造者,退化为提供电力和初始指令的观察者。这种转变究竟是效率的飞跃,还是人类心智领地的萎缩?deepmind.google/blog/alphaevolve-impact
查看原文链接
87
微软研究院最近发了第五版《新工作未来报告》,这次的关注点很有意思:…
作者: 默庵·超级个体 | 时间: Fri May 08 08:39:32 +0800 2026 | 分类: 工具产品
时效性:56.5 | 来源可信度:42.0 | 新意:60.0 | 传播性:54.7 | 信息密度:79.0 | 知识性:94.0 | 原创信号:94.0
事件概览
聚类条数 2 / 账号数 2 / 转发 27 / 评论 1 / 点赞 42
原文
微软研究院最近发了第五版《新工作未来报告》,这次的关注点很有意思:不再讨论一个人用AI能多厉害,而是追问一个更现实的问题,团队和组织能不能靠AI一起变得更好?答案没那么乐观。报告里藏着好几个反常识的发现。第一个,如果你主动告诉同事自己用了AI,别人对你的评价反而会下降。你会被认为更懒、能力更低、不够勤奋、甚至不道德。而且这里面还有性别差异,同样是用AI辅助写代码,女性程序员被扣的能力分数是男性的两倍多。理性上大家都知道AI是工具,但情感上还是会觉得「自己做才算本事」,这个社会共识短期内不会消失。第二个,AI每天能帮个人省下40到60分钟,但这些省下的时间,很多时候只是把成本转移给了队友。报告里提到一个新词叫 Workslop,可以翻译成「AI废料」,就是那些看起来像样、实际上空洞甚至有错误的AI生成内容。调查显示大约40%的职场员工在过去一个月收到过这种东西。你用AI省了半小时,同事可能要花更长时间去核实和修正你发过来的内容。第三个,AI在团队协作层面目前还很笨。它不懂共识是怎么建立的。两个人对话的时候,会有大量隐性的信号交换,确认对方理解了没、调整措辞、感知情绪、建立信任。AI生成回答的时候直接跳过了这个过程,输出一段「看起来已经达成共识」的文本,但双方其实并没有真正对齐。第四个,也是我觉得最值得警惕的,叫「认知去技能化」。医疗领域有研究发现,临床医生开始用AI辅助检测肠息肉之后,仅仅三个月,他们独立识别癌前病变的能力就出现了显著下降。编程领域也有类似证据,非技术背景的人借助AI完成了技术任务,但一旦失去AI访问权限,能力立刻消失。用进废退,大脑很诚实。第五个,AI对年轻人的冲击比想象中大得多。在高AI暴露度的岗位上,22到25岁员工的就业率比低AI暴露度岗位下降了约16%。原因很直接:年轻人刚入职做的那些基础工作,整理资料、写初稿、做分析、跑流程,恰恰是AI最擅长的。但问题在于,这些基础工作本来就是年轻人积累经验、训练判断力的过程。如果这个阶段被AI接管了,他们少的不是一点苦,而是一段能力生成的完整过程。第六个,关于创意。研究发现,如果你先独立构思再引入AI,产出的原创想法会更多;但如果先看AI建议再自己构思,原创想法反而变少。更麻烦的是这种影响有残留效应,即使之后停用AI,独立构思的质量也没有完全恢复。AI会在你思维里留下一个锚点,让你不知不觉在更窄的范围里打转。报告最后也提到了AI在团队中可能扮演的几种角色:共同构思者、魔鬼代言人、调解员、会议协调员。这些方向有潜力,但目前都还在实验室阶段,距离AI真正成为一个靠谱的团队成员,还有相当长的路要走。总结一下:AI让个人变强这件事已经被反复证明了,但让一个团队、一家公司一起变强,这个问题远比想象中复杂。个人生产力和集体生产力之间,存在一道真实的鸿沟。而对每个人来说,更值得关注的可能是:当AI越来越早、越…
查看原文链接
88
#好资料复读# “看见统计”这个网站 ( seeing-theor…
作者: 蚁工厂 | 时间: Fri May 08 18:05:28 +0800 2026 | 分类: 新闻
时效性:72.2 | 来源可信度:42.0 | 新意:41.0 | 传播性:82.2 | 信息密度:67.9 | 知识性:65.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 389 / 评论 17 / 点赞 289
原文
#好资料复读# “看见统计”这个网站 ( seeing-theory.brown.edu/cn.html )可以在线学习统计学。包括基础概率论、进阶概率论、概率分布、统计推断:频率学派 、统计推断:贝叶斯学派、回归分析 看见统计是由Daniel Kunin在布朗大学读本科的时候开始制作。致力于用数据可视化让统计概念更容易理解。 网站有中英双语。#AI创造营#
查看原文链接
89
#微博声浪计划# #听见微博# 上期播客我有提及最近去大内串台又聊…
作者: 明浩-rosicky311 | 时间: Fri May 08 13:40:27 +0800 2026 | 分类: 新闻
时效性:64.9 | 来源可信度:42.0 | 新意:63.0 | 传播性:27.2 | 信息密度:93.0 | 知识性:98.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、anthropic 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 7
原文
#微博声浪计划# #听见微博# 上期播客我有提及最近去大内串台又聊了一期AI的节目,本期播客就是这期的串台节目,大内已经更新,这里:我和大内的主播相征相爷聊了很多,比如图片模型的再次进化,Manus事件的种种,AI短剧的进化,美国AI行业最近1-2个季度的更新、AI所引发的复杂社会问题、以及个体的焦虑等等。纯纯个人闲扯,不代表也代表不了什么……我在shownotes配了大量的图,我建议大家配着shownotes一起收听这期播客。(想加粉丝群的请先+微信:rosicky311)下面正片开始……【时间线】00:23 上次去大内是25年12月初00:39 当时一个印象深刻的评论02:18 上次聊天的时候相爷用nano banana画的“宫本武藏”03:30 我看到的两个image2案例:抖音直播间+游戏联动海报05:15 相征用image2做的图07:57 老司机阑夕的“作品”09:12 我们开始聊Manus10:15 我对Manus事件的梳理13:41 当时Manus中文区的公告21:42 Meta的收购其实已经交割了22:50 两种极端的观点:在商言商 VS 大国博弈24:34 另外一场中美的博弈:Tiktok事件26:29 世界名画:周受资在美国国会29:02 “对面的帮派实在是太不讲规矩了”……29:16 之前美国政府逼迫昆仑拆分男同平台grindr29:41 国会关注腾讯100%控股拳头游戏以及持有EPIC约40%股份31:43 外资管理办法的要求33:40 Meta可以不理吗?34:08 外媒报道,Meta愿意撤销34:14 openclaw的崛起可能对Manus的价值产生影响35:40 美元投资者为什么会被打上自由派/右派的标签?36:05 当年的“滴滴上市”事件38:20 新的趋势:拆vie,不允许拿美国的投资……39:20 两套规则,两套玩法41:41 新时代对于硬科技方向创业者提出的新要求42:47 Manus事件的个人总结43:30 这其实不是个例,最近的新案例就是盛大陈天桥MiroMind事件45:33 中美在AI上的军备竞赛49:24 极端事件频繁上演51:15 爱奇艺AI艺人与AI短剧的案例55:25 三联的那篇文章:39岁的横店“戏王”,为何已经“无戏可拍”?60:15 重轻去今年GDC的感受播客--非常推荐国产游戏正在改写底层规则,GDC 2026就是信号63:56 Anthropic如何看待下一代软件65:20 AI焦虑是杞人忧天吗?65:43 26年到现在美国科技巨头的大裁员67:37 “恩格斯暂停”68:57 蒸馏员工,Meta在认真的干72:09 头部AI研究员安全吗?完全不安全~72:54 Harness的比喻73:17 “自主进化”75:17 Harness到底是什么?77:32 软件会被取代么?78:34 是否有什么…
查看原文链接
90
急招数据标注员
作者: 量子位 | 时间: Fri May 08 12:39:00 +0800 2026 | 分类: 新闻
时效性:63.2 | 来源可信度:42.0 | 新意:59.0 | 传播性:38.7 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 5 / 评论 1 / 点赞 5
原文
急招数据标注员!不需要AI经验、朝九晚五、有培训……个别岗位年薪达到9-13万美元(61-88万人民币),还有现金和股票激励。这么一算,岂不是四舍五入百万年薪了。特斯拉新鲜出炉的招聘启事,看起来心动不?Tesla AI 工程总监Phil Duan也转发了:加入我们,共同打造全球最大的真实世界人工智能数据引擎。如果你不熟悉这个人,他的中文名叫段鹏飞,刚在今年2月被马斯克提拔为Autopilot工程总监。他亲手带队做出了FSD v12/v13/v14、Robotaxi发布,以及特斯拉最重要的Occupancy Network。技术负责人亲自发帖,就一个意思:数据引擎要转起来了,缺人。那么,事情就变得有意思起来了:数据标注,这个大家印象中AI产业链里门槛较低的工种,为何突然成了特斯拉最想要的人?网页链接
查看原文链接
91
面向AI智能体的一款统一虚拟文件系统:Mirage,让AI Age…
作者: AIGCLINK | 时间: Fri May 08 09:35:04 +0800 2026 | 分类: 工具产品
时效性:58.0 | 来源可信度:42.0 | 新意:67.0 | 传播性:53.6 | 信息密度:84.0 | 知识性:75.0 | 原创信号:84.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 ai、智能体、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 24 / 评论 2 / 点赞 21
原文
面向AI智能体的一款统一虚拟文件系统:Mirage,让AI Agent用bash一招打天下,不用学N个APIMirage等于给AI搞了一个万能硬盘,各种分散的数据都被映射成同一个文件系统,AI可以用Unix命令直接操作S3、Google套件、Slack、Gmail、GitHub、Linear、Notion、MongoDB、Redis、SSH等等全部挂载到同一个文件树下,AI看到的是一个统一的目录结构复用AI已有的Bash知识,cat、grep、head、wc、管道等命令在所有挂载点通用,无需额外学习即可直接使用Python和TypeScript SDK可直接嵌入FastAPI、Express、浏览器应用支持快照、克隆、回滚,Agent的执行环境可以打包迁移,实验可复现Index cache+File cache两层,重复读取零网络调用支持OpenAI Agents SDK、Vercel AI SDK、LangChain、Pydantic AI、CAMEL、OpenHands、Mastragithub:网页链接#Mirage##虚拟文件系统#
查看原文链接
92
今天的#60秒芯闻# ,这是我们的一个金牌栏目,网友评论这是半导体…
作者: 张国斌的芯时空 | 时间: Sat May 09 09:57:43 +0800 2026 | 分类: 新闻
时效性:98.7 | 来源可信度:42.0 | 新意:55.0 | 传播性:8.0 | 信息密度:75.0 | 知识性:90.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
今天的#60秒芯闻# ,这是我们的一个金牌栏目,网友评论这是半导体里的”参考消息“!每日精选半导体业界新闻,点击链接可以查看详细内容!#张国斌的芯思考##张国斌的芯发布# 1 总投资295亿!TCL华星宣布t8项目提前封顶:全球首条G8.6代印刷OLED产线2 谷歌正在开发Tensor G7:继续采用2nm工艺3 技嘉AI 产品阵容荣获红点设计奖肯定4 弘信电子跨越业绩拐点 双轮驱动发力净利大增5 DB HiTek将参加2026年PCIM展会,加强其在欧洲市场的布局6 海信携手《影之刃零》打造新一代RGB游戏体验7 2026 年第一季度 DigiKey 新增近 31,000 种零件及 97 家供应商,进一步扩充了现货产品供应8 Molex莫仕获“技术创新生态伙伴”奖,继续推动本地汽车行业健康发展9 全面布局人形带电作业机器人,开普勒 K2 大黄蜂在20米高空实现带电焊接作业应用10 Power Integrations高可靠轨道交通解决方案:铁路级 SCALE-2 门极驱动器11 治精微推出ZJC2400 20位1.8MSPS全差分SAR ADC12 湖南静芯推出专用于USB4 V2和Thunderbolt5接口的静电保护器件SEUCS2X1V1BE13 【国内首款】帝奥微DIO61390 10A大电流系列重新定义智能终端的能效边界14 华北工控MATX-6988金融智能终端专用计算机:提供增强性能与可信计算环境15 高增益、小体积 | 博瑞集信推出MMIC驱动放大器产品系列16 安勤科技推出全新OFM系列开放式触控显示器,提供灵活嵌入应用与卓越视觉体验17 意法半导体高速GaN驱动器为运动控制与功率转换应用增加智能保护功能18 紫光展锐携手斑马智能联合发布端侧AI Box创新产品19 HOLTEK新推出HT68RV034L Voice OTP MCU20 IBM Bob正式发布:贯穿软件开发全生命周期,助力企业从 AI 辅助编程迈向生产就绪软件网页链接
查看原文链接
93
午夜#学术新闻# 清华大学丘成桐数学科学中心(YMSC) 招聘信息
作者: 物理芝士数学酱 | 时间: Fri May 08 23:58:00 +0800 2026 | 分类: 新闻
时效性:82.0 | 来源可信度:42.0 | 新意:55.0 | 传播性:36.8 | 信息密度:70.5 | 知识性:82.3 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 4 / 评论 1 / 点赞 8
原文
午夜#学术新闻# 清华大学丘成桐数学科学中心(YMSC) 招聘信息。年薪范围:60 万 – 350 万人民币。正教授 / 副教授(终身教职及高级教员)学科领域:数学、统计学、量子计算、人工智能与大数据、成像科学、材料科学、数理物理、数字金融与区块链等。薪资根据申请者资历决定📄 申请条件数学科学或相关领域博士学位学术领导力与声誉优秀的发表与教学记录📑 申请材料求职信、履历、研究陈述、教学陈述、出版物列表五篇精选论文及预印本四封推荐信(其中三封研究推荐信,一封教学推荐信)⏰ 截止日期2027 年 5 月 7 日 上午 11:59(中国时间)
查看原文链接
94
我个人是不太爱留现金的,当然也适合现在的年龄段,除了紧急资金存够了…
作者: 车库工程师 | 时间: Fri May 08 23:30:46 +0800 2026 | 分类: 模型
时效性:81.3 | 来源可信度:42.0 | 新意:59.0 | 传播性:34.4 | 信息密度:80.1 | 知识性:74.3 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 1 / 点赞 15
原文
我个人是不太爱留现金的,当然也适合现在的年龄段,除了紧急资金存够了,再多存边际效应很低,其他都让它运转起来。最近跟gpt,gemini分析一下。有句话说得很好,不要试图在所有赛道上同时踩油门,学会给不同赛道设置波峰和低谷。等着一波投资调整完我又会放着大半年不动了,把精力省下来转投工作和其他事情里。而这段期间,就是股市给送钱。另外,昨天也写了一些关于社媒的个人态度,关于个人媒体,也有波峰和低谷,我也佛系,有想说的多写写,有时候也可以断网降速,去降皮质醇,选择去休息。主要还是,不能在所有赛道上同时踩油门。
查看原文链接
95
#模型时代# a16z:自1940年以来创造的大多数新工作岗位,在…
作者: 程序员邹欣 | 时间: Fri May 08 16:29:54 +0800 2026 | 分类: 工具产品
时效性:69.6 | 来源可信度:42.0 | 新意:45.0 | 传播性:51.7 | 信息密度:86.0 | 知识性:96.0 | 原创信号:68.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 20 / 评论 11 / 点赞 35
原文
#模型时代# a16z:自1940年以来创造的大多数新工作岗位,在1940年甚至都不存在。1、“AI 工作末日论”建立在一个错误假设上:社会中的工作总量是固定的。只要 AI 多做一点,人类就少做一点。这个判断忽视了一个基本事实:人的需求、市场需求和经济活动会随着技术进步不断扩张。2、AI 会替代部分任务,也会压缩部分岗位,但这不等于永久性大失业。真正的变化是劳动力重新配置。认知成本下降后,产品会变便宜,服务会变快,过去不经济的需求会变得可行,新的行业和岗位会随之出现。3、历史经验支持这一点。农业机械化让美国农业就业占比从约三分之一降到约2%,但并没有摧毁就业市场;电气化重组了工厂和消费品产业;电子表格减少了传统记账工作,却扩大了金融分析、FP&A 等岗位。技术通常消灭的是旧任务,而不是人类工作的总需求。4、AI 更大的影响可能是增强劳动,而不只是替代劳动。部分岗位会被压缩,部分岗位会因为 AI 提高生产率而更有价值。企业目前讨论 AI 时,也更多把它视为能力放大器,而非单纯裁员工具。5、因此,关键问题不是“AI 会不会让人类没工作”,而是哪些任务会被自动化,哪些岗位会被重塑,哪些新需求会被释放,以及劳动者能否顺利完成技能迁移。报告地址:www.a16z.news/p/the-ai-job-apocalypse-is-a-complete
转发者评论
无人扫地车的维修...//@whatAFancyWorld:县里采购无人扫地车,月薪一千块的环卫工数量少了,对于他们那就是最后一比现金收入也没有了
查看原文链接
96
【#榴莲遭仅退款商家驱车1600公里找买家#:派出所立案】#榴莲遭…
作者: 黄健楸 | 时间: Fri May 08 08:40:39 +0800 2026 | 分类: 新闻
时效性:56.5 | 来源可信度:42.0 | 新意:41.0 | 传播性:88.2 | 信息密度:73.3 | 知识性:84.6 | 原创信号:68.0
为什么重要
它更像一条新闻信号;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 693 / 评论 4030 / 点赞 56905
原文
【#榴莲遭仅退款商家驱车1600公里找买家#:派出所立案】#榴莲遭仅退款商家翻遍垃圾桶找证据#5月7日,河南濮阳一销售冷冻榴莲果肉商家称遭山东德州一买家恶意“仅退款”。商家称于4月26日发货,28日买家称榴莲发霉,申请“仅退款”。商家查看发货视频及买家提供的图片后,表示买家图片中的霉变榴莲非发货商品。商家前后花费5000余元,两次驱车行驶1600公里往返买家所在地沟通。商家在买家住处附近垃圾桶中找到榴莲包装袋,未找到榴莲,买家称霉变榴莲已分开丢弃。商家报案,庆云县公安局徐园子派出所已立案。 新京报的微博视频
转发者评论
不用调包,现在 AI 可以生成发霉图片,仅退款真得限制//@沈沉舟:社会需要这样认真的人。
查看原文链接
97
Anthropic 的 Claude Mythos 让 Mozil…
作者: 新智元 | 时间: Fri May 08 18:02:46 +0800 2026 | 分类: 模型
时效性:72.1 | 来源可信度:42.0 | 新意:63.0 | 传播性:31.5 | 信息密度:82.7 | 知识性:82.2 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、claude、anthropic 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 2 / 点赞 4
原文
Anthropic 的 Claude Mythos 让 Mozilla Firefox 4 月单月修复 423 个安全漏洞,超过过去 15 个月总和。271 个由 AI 直接发现,180 高危。藏 20 年的 XSLT bug、15 年的 HTML legend bug 被翻出。沙箱逃逸顶格赏金 2 万美元那种,Mythos 找到的数量超过所有人类安全研究员总和。 新智元的微博视频
查看原文链接
98
# 给 AI Agent 设计工具的最佳实践AI Agent 之所…
作者: 蚁工厂 | 时间: Fri May 08 11:45:41 +0800 2026 | 分类: 工具产品
时效性:61.7 | 来源可信度:42.0 | 新意:55.0 | 传播性:46.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:44.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、llm 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 12 / 评论 5 / 点赞 16
原文
# 给 AI Agent 设计工具的最佳实践AI Agent 之所以能力比直接使用 LLM 更强,来自于环境和运行在环境中精心设计的工具。直接将已有API粗暴的转化为Agent工具,虽然能用,但是往往伴随着额外的工具组合调用的成本,甚至引入更多的不确定性。AI Agent 的核心工具需要精心设计。目前业内并没有四海皆准的唯一正确答案,这篇文章将基于 Anthropic、OpenAI、Block(60+ MCP 服务器)、GitHub、Phil Schmid、arXiv 论文等多个来源的建议和经验,加上我们自己在开发 [LinklyAI](网页链接) 的 Agent 工具的实践经验撰写,试图整理出一份当下对 Agent 工具的设计 “共识”。## 核心原则1. **为结果设计,不是为接口设计。** 好的 AI 工具不是 REST API 的薄封装,而是把一个完整的用户工作流打包成尽量少的调用。让 Agent 少做编排,多拿结果。2. **工具越少越好,描述越清楚越好。** 实践中收敛到每个 Server 5-15 个工具。一项对 856 个 MCP 工具的研究发现,97.1% 的工具描述存在质量问题,56% 连基本用途都没说清。准确简洁的描述,就能提升任务成功率 5-15 个百分点。3. **每个 token 都是成本。** 返回高信噪比、分页、截断的输出;减少类似UUID之类编码,而用name之类的有意义的字符串替代;参数尽量扁平化;错误信息要教 Agent 下一步怎么修复。## 十大设计原则> 按出现频率排序### 1. 面向结果设计,而不是面向接口不要把每个 API 端点都暴露成一个工具。把多个内部调用合并成一个面向任务的工具。**反面**:`get_user` → `list_orders` → `get_shipment`(Agent 需要调三次)**正面**:`track_order(email)`(一次搞定)Block 的 Linear MCP 从 30+ 工具精简到 2 个;GitHub Copilot 从 40 个砍到 13 个,任务成功率提升 2-5 个百分点,延迟降低 400ms。### 2. 控制工具数量(5-15 个/Server)默认工具绝对不是越多越好,超过 20 个工具,模型的工具选择准确率急剧下降,切勿过渡依赖模型挑选工具的能力。5 个 MCP Server 可能在用户还没说话之前就消耗 55K token。做法:一个 Server 只做一件事,删掉没人用的工具,不常用的工具用动态发现(Tool Search)延迟加载。### 3. 工具描述就是 Prompt,要像写 Prompt 一样写一个好的描述应该包含六个要素:- **用途**:这个工具做什么(一句话)- **何时使用**:在什么场景下应该调用- **何时不使用**:…
查看原文链接
99
这是一个真实的事件一位硅谷华裔工程师Brian,他带着“美国要完”…
作者: 马少平THU | 时间: Fri May 08 08:25:31 +0800 2026 | 分类: 用法技巧
时效性:56.1 | 来源可信度:42.0 | 新意:41.0 | 传播性:83.8 | 信息密度:79.0 | 知识性:82.0 | 原创信号:68.0
为什么重要
它对实际使用方法有直接参考价值;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 456 / 评论 1354 / 点赞 8706
原文
这是一个真实的事件一位硅谷华裔工程师Brian,他带着“美国要完”的心态去中国,两周后返回时感慨“so good to be back”,并得出结论——中国擅长优化,美国擅长创新,而长期来看,创新者更胜一筹。他没谈GDP、没谈芯片,只分享了三个日常细节:• 在清华课堂上,几乎没人主动提问;• 满大街的人都在刷短视频;• 全民都在用AI,但几乎没人焦虑失业。Brian(@bdguan)在帖子里提到:中国教育培养出了世界级的执行者,但难以产生“怪人”和打破常规的创新者。美国则在后者上有独特优势。他在清华旁听(与表弟一起,表弟在清华,奥数金牌)看到课堂安静:学生除非教授点名,否则不主动发言、无提问、无辩论。这个观察帖在中美网友中都引发了热议,尤其对正在考虑送孩子出国留学的家庭来说,是一个值得认真对照的真实案例。你怎么看?
转发者评论
我的课有300多人,我会适当的提问,疫情期间用雨课堂上课,我打开弹幕,学生用弹幕提问,问题也不少,我觉得挺好的,疫情结束后,线下上课我也同时打开雨课堂,只为可以弹幕提问。//@退而思之xyq:这三点的确是真的,虽然不一定是全部都这样,工作后开会国人也是发言的不多。后两点貌似是字节跳动的锅了
查看原文链接
100
最近在梳理这半年的成长,得与失,我觉得经历是一种打磨吧
作者: 车库工程师 | 时间: Fri May 08 23:47:23 +0800 2026 | 分类: 模型
时效性:81.7 | 来源可信度:42.0 | 新意:55.0 | 传播性:34.4 | 信息密度:77.8 | 知识性:78.9 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 1 / 点赞 29
原文
最近在梳理这半年的成长,得与失,我觉得经历是一种打磨吧。Gemini给了我一个描述,我很喜欢,大致意思是,你若经历核心事件的洗礼以后,整个人会不太一样。反过来想想也是,如果我没有去经历摩擦。那么我只会继续留在温室里,也许我的生活只能是那些bubble里的东西,看着美好,却也像玻璃一样易碎。以前像运行顺畅的服务器,没有受攻防训练,安全漏洞补丁,一旦中病 毒,就宕机。只有去经历摩擦,我自己的风格,韧性,张力才能打磨出来。其实许多事情我感觉都在加速进行,很多事未来不可预测,就是习惯那种变化,适应变化。响应反脆弱开头那句话,如何从不确定性中获益? 波动中,不确定性中的成长是非线性的。只有这样,才能转变思想,爱上那些变化,都是助我一臂之力。
查看原文链接