1
斯坦福的教授vibe coding的课程《现代软件开发者》要出新版…
作者: 蚁工厂 | 时间: Thu Sep 03 07:48:07 +0800 2026 | 分类: 新闻
时效性:95.3 | 来源可信度:42.0 | 新意:79.0 | 传播性:61.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 3 / 转发 52 / 评论 2 / 点赞 47
原文
斯坦福的教授vibe coding的课程《现代软件开发者》要出新版啦~讲师Mihail Eric介绍:“我非常激动,终于可以宣布我的斯坦福课程《现代软件开发者》(The Modern Software Developer)推出最新版了。为了这次更新,我们已经筹备了整整 9 个月。去年 11 月,随着 Claude Opus 4.5 发布,编程智能体的能力迎来了一次跃迁式提升。我们所有人都切身感受到了这一变化:大语言模型变得更加强大,能够进行更长时间的推理,也能解决难度更高的任务。今年的课程迭代,正是对 2026 年软件工程行业巨变的回应。我的核心理念很简单:在大语言模型时代,AI 原生开发者将成为任何软件组织中最重要的成员。设计这门课程,就是为了培养新一代这样的工程师。这一次有什么不同?首先,我将舍弃 2025 年秋季课程中 85% 的内容。2026 年秋季的新教学大纲将聚焦 AI 原生工程师必须具备的核心能力,包括:智能体技能、高级上下文工程、MCP 门户、面向智能体的代码库设计原则、智能体驱动的代码审查、安全、后台智能体并行化、软件工厂,以及更多内容。其次,我将教会学生如何培养“软件品味”。每一位学生都必须向生产级的真实代码库提交并交付拉取请求(Pull Request)。本课程还将与顶尖的开源 AI 项目合作,由这些项目为学生提供支持和指导,帮助他们以真正有价值的方式为项目作出贡献。”课程主页: themodernsoftware.dev目前课件什么的还没更新,估计要在11月之前陆续更新~
查看原文链接
2
斯坦福刚开了一门教你从零开始构建智能体的课程:CS 329Z: E…
作者: 蚁工厂 | 时间: Thu Sep 03 08:46:26 +0800 2026 | 分类: 工具产品
时效性:96.9 | 来源可信度:42.0 | 新意:79.0 | 传播性:64.6 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、ai、智能体 等关键词,信息密度…
事件概览
聚类条数 3 / 账号数 3 / 转发 71 / 评论 6 / 点赞 65
原文
斯坦福刚开了一门教你从零开始构建智能体的课程:CS 329Z: Engineering AI Agents地址:cs329z.stanford.edu/目前课程课件还未上传,课程大纲和阅读材料已经公布了。“从单体式语言模型转向复合型 AI 系统——即由大语言模型(LLM)、检索器、工具和优化器等多个相互协作的组件组成的系统——标志着面向用户构建 AI 应用的方式发生了根本性转变。本课程将教授学生如何设计和构建智能体系统,内容覆盖从简单的 LLM 流水线、复合型 AI 系统,一直到自主智能体的完整技术谱系。学生将学习如何确定值得重点解决的问题类型、拆解问题、选择合适的组件、收集和整理数据、建立评测体系,以及分析在实际构建这些系统时需要面对的各种设计权衡。学生首先会从零开始构建检索增强生成(RAG)、工具调用和智能体循环等核心组件,随后学习 DSPy 等框架如何对这些常见模式进行抽象。通过两项高度实践性的作业和一个贯穿整个学季的项目,学生将获得构建、优化及评估智能体系统的实战经验。”
查看原文链接
3
一个 skill,让你做出顶级审美的图表
作者: AIGC·非著名程序员 | 时间: Thu Sep 03 07:59:02 +0800 2026 | 分类: 新闻
时效性:95.6 | 来源可信度:42.0 | 新意:72.0 | 传播性:65.0 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、aigc、agent 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 74 / 评论 4 / 点赞 113
原文
一个 skill,让你做出顶级审美的图表。最近发现了一个开源项目叫 Lieflat Charts,在 GitHub 上已经拿到 2k star 了。简单说,它是一套专门给 AI agent 用的数据可视化 skill,Moxt、Claude Code、Codex 这些主流 agent 都能直接装上用。先说它最打动我的地方:审美是统一的。字体、留白、线条、动效,全部遵循同一套视觉语法。这意味着你不管出什么图,风格都是协调的,不会东一个配色西一个字号,拼在一起像缝合怪。图表类型覆盖得也很全,60 多种。柱状图、折线图、面积图、直方图这些基础款自然不用说,热力图、小提琴图、环形关系图、桑基图这类复杂图型也都有,部分还支持交互操作。配色方面走的是克制路线,默认黑白灰单色打底,干净利落。如果你需要一点色彩表达,也提供了青瓷蓝、椰林绿、编辑红三种色系可选,后续还会继续扩展。它的底层原理是用 HTML 来渲染图表,这个思路带来一个很实用的好处:动效非常丰富,而且可以无缝嵌入 HTML 做的 PPT 里。如果你需要传统 PPT 格式,也可以让 agent 把图表转成动图再贴进去,灵活度很高。使用门槛极低。装好之后,你只需要把数据丢给 agent,或者告诉它你想可视化什么主题,它会自动选择合适的图表类型帮你出图。如果你要出完整的数据报告,它还有一个报告模式,一键生成带图表的可视化报告。说白了,以前做一张好看的图表,你得懂设计、懂配色、懂排版,现在这些活儿全交给一个 skill 就搞定了。对经常需要做数据展示的人来说,值得一试。传送门:github.com/larashero3-dotcom/lieflat-charts#科技先锋官##How I AI# AIGC·非著名程序员的微博视频
查看原文链接
4
Harness 的评测榜单 FrontierHarness v1.…
作者: i陆三金 | 时间: Thu Sep 03 09:33:12 +0800 2026 | 分类: 模型
时效性:98.2 | 来源可信度:42.0 | 新意:74.0 | 传播性:47.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、提示词、gpt 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 13 / 评论 3 / 点赞 6
原文
Harness 的评测榜单 FrontierHarness v1.0 测试 harness 包括:Pi、Exo、Claude Code、Codex、DeepSeek Harness(4款)、Hermes、OpenCode、Oh My Pi、Kimi Code测试模型:Kimi K3(选择K3,而不是 GPT、Claude,是因为测试者不想偏向 Codex 和 Claude Code)任务类型: 21 项终端基准测试任务和 9 项深度软件工程任务要点总结:- 一共 360个任务,12款 harness。209 次成功,151 次失败。整体通过率为 58.1%。- 完成率最高的是 Codex,66.7%(20个完成);其次是DSH Creator 和 Claude Code,63.3%(19个完成),但 CC 单次通过的花费却高出 5.6 倍,同时也是耗时最长的。- CC 的平均花费更高,是因为在其 19个成功案例中,有 3 个测试的 token 使用量占比高达 88%,其中最大的任务消耗了 24.6M token(占了 68%的用量),但缓存命中率只有 15.7%。分析认为一个重要原因在于测试框架与模型的适配问题。Claude Code 专为 Anthropic 模型设计,依赖其显式缓存控制语义。而 K3 平台暴露的是行为机制不同的隐式前缀缓存系统,原有的缓存策略可能无法无缝迁移。这种现象源于测试框架与模型的整体配置特性,未必是 Claude Code 本身的缺陷。- 完成率最差的是 OpenCode和 Hermes,50%(15个完成)。- 与模型出自同源的 Kimi Code,在完成率上并列第七(56.7%),成本效益则处于中游水平。- 当同一任务需要反复执行且令牌消耗累积时,Pi 模型则是更优选择。- Exo 在每个完成任务上成本最低(1.05 美元),部分原因在于其提前终止机制:面对最困难任务时,它在达到 51 步上限后以 1.46 美元成本终止,而其他框架仍在持续消耗资源。- DSH 的对比揭示了预设配置的重要性。在同一模型和运行时下,其四套预设配置的通过率相差 6.6 个百分点,成本差异达 1.4 倍。- 成本差异主要源于框架与模型的配对组合。缓存策略、工具循环和提示词设计都属于配对特性,而非框架固有属性;为某系列缓存机制优化的框架在此场景可能表现高效,在其他环境中却会显得昂贵。链接:runta.com/blog/introducing-frontierharness-eval
查看原文链接
5
Anthropic刚刚把过去给商家用Claude做的购物AI助手开…
作者: AIGCLINK | 时间: Thu Sep 03 08:35:26 +0800 2026 | 分类: 模型
时效性:96.6 | 来源可信度:42.0 | 新意:74.0 | 传播性:50.7 | 信息密度:96.0 | 知识性:96.0 | 原创信号:92.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 18 / 评论 0 / 点赞 9
原文
Anthropic刚刚把过去给商家用Claude做的购物AI助手开源了,把踩坑经验整理成的施工手册具体的开源实现中,给配了两个完整可运行的Agent,购物Agent、商家Agent,代码、技能、工具契约、安全门禁全部已写好覆盖四个行业,零售、旅游、电信、票务,每个开箱即跑,带网页界面,以及安全机制先说场景,消费者端:你逛淘宝/订机票时,有个AI陪你,你想要啥它帮你找、比价、准备好订单;商家端:卖家也有个AI帮手,查销售数据、拟价格方案、管库存、做促销等几个核心经验1、用一个聪明的大脑别拆一堆小AI,用一个AI装技能手册很多人会客服一个AI、退货一个AI、购物一个AI……这样不对,因为聊天是连续的,你聊着退货突然问“那我购物车里的东西还买吗”,拆开的AI各管一段就会丢上下文应该是是一个AI+一摞skills,用到哪本翻哪本系统提示词 vs 技能怎么分?系统提示词:放高频用到的东西,比如安全规则、品牌要求、购物车逻辑、商品搜索技能:放长尾功能,比如售后客服、营销分析、旅行规划),需要时再加载工具设计上,智能体应该调用企业已有搜索、库存、促销引擎等,而不是让AI自己算库存、自己定价UI也是工具,不要让AI输出自定义标签然后前端解析,而是把商品卡片、座位图、行程单都定义为工具调用,AI输出结构化参数,服务器验证后直接渲染,这样更可靠,历史记录也能直接复用2、延迟很重要,但完成任务的质量更重要,让用户感觉快,不是变笨怎么让AI更快?减少对话回合、工具加速、感知延迟提示缓存省钱的大招,电商场景非常适合缓存,优秀部署能达到90-99%的缓存命中率另外不要凭感觉选模型,建议商家后台用更聪明的Opus(分析任务重),消费者端用更快的Sonnet(延迟敏感)3、上线只是开始AI要记住用户偏好,比如鞋码、过敏信息、常看的报表,不能存在模型里,要存在数据库涉及钱的操作,比如下单、支付、改价、启动活动,AI只能生成待确认的方案,必须由人工或既定审批流程确认后才能执行AI是非确定性的,改一点提示词可能带来意外后果,所以需要自动化测试博客:网页链接github:网页链接#AI商务助手##claude电商AI助手# AIGCLINK的微博视频
查看原文链接
6
#微博声浪计划# #听见微博# 今天的嘉宾是战略学家曾鸣教授
作者: 张小珺Benita | 时间: Thu Sep 03 08:10:56 +0800 2026 | 分类: 工具产品
时效性:95.9 | 来源可信度:42.0 | 新意:74.0 | 传播性:44.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 9 / 评论 0 / 点赞 19
原文
#微博声浪计划# #听见微博# 今天的嘉宾是战略学家曾鸣教授。曾教授曾经是阿里巴巴集团总参谋长,也参与过两所商学院创建(长江商学院和湖畔),但他更令人熟悉的身份是:一名对企业战略有许多深度思考的研究者。不少创业者和企业家都受到过他的启发。作为观察过互联网完整周期的研究者,今天我们聊了聊他对AI新时代、新范式的完整思考,并和历史上关键转折时期做了对照——聊完让我有了更全局的视角。对AI的产业发展,曾教授提出了许多非共识判断,甚至是一些“暴论”。这里我先摘录15条:AI产业化会有三个阶段:1)第一个阶段,技术逐渐被社会接受,成为社会基础设施;2)第二个阶段,基于基础设施产生海量新应用,进入百花齐放的时代;3)第三个阶段,当这些海量应用出现,大家发现需要一些更底层的方法运行新的世界,我把它叫作“原生应用阶段”。我只是研究商业世界的动力学规律,我能看到的理论框架告诉我:第一阶段的企业,很难活到第二阶段;第二阶段的企业,很难活到第三阶段。对比互联网时代,我们现在刚刚走到浏览器阶段,甚至比Yahoo还要早。模型公司怎么类比?它有点像另外一个已经消失了的公司——美国在线AOL,它是互联网基础接入服务商,让所有人都能够接到互联网上,这本身是个巨大的工程。今天,大模型则是让所有人都可以轻易接入智能的入口,它也是一个基础设施服务商。直白一点说,模型公司就是未来的AI云公司。公共基础设施的行业,只有一种商业模式是成立的,叫寡头垄断加政府强监管——我知道这个现实对很多现在创业的人很残酷。Anthropic、OpenAI,大概率不是原生应用阶段的大玩家、大赢家。因为经济学基本规律,只要有同质化的供给,你就不可能获取高额利润,你就是一家不怎么值钱的公司。下个阶段就是看谁是Netscape、谁是Yahoo,谁把Agent的标准建立起来,谁抢住Agent的用户入口。未来三年是有可能开始出现Agent入口的。新的平台大概率不诞生自旧的平台。因为旧平台做的是简单信息匹配,新平台要做的是能力跟需求的匹配,复杂度高了很多。作为工业化革命的产物,科层制管理的公司制度会衰亡——就是说,“公司”会消亡。这没有什么可以遗憾的呀,将来有更好玩的——你说多少人现在去公司上班是开心的?我从来觉得在巨浪面前没有人是安全的。谁觉得安全,谁就是最不安全的。CEO不能有老板心态。谁还认你啊?——现在说我都不陪老登玩了,我还陪你老板玩?张:这个时代的企业过渡到下一个时代的企业,还能做得非常好的,多不多?曾:不是多不多的问题,是有没有的问题。张:有没有?曾:基本没有。这一点都不让人绝望啊,人有生老病死,公司也有生老病死,没有比这更正常的了。这样,新公司才有机会,年轻人才有梦想,这多好的一件事情啊!好了,更多内容还是收看我们的播客吧:)接下来,就是我对曾教授的访谈。OUTLINE:00:03:08 来自商业规律的残酷真相0…
查看原文链接
7
Google 今天发布了 Gemini 3.8 Flash,同时推…
作者: 宝玉xp | 时间: Thu Sep 03 07:23:37 +0800 2026 | 分类: 模型
时效性:94.6 | 来源可信度:42.0 | 新意:69.0 | 传播性:46.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 12 / 评论 10 / 点赞 43
原文
Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。Google 最近这个发布节奏很有意思。7 月底发 3.6 Flash,8 月中发 3.7 Flash,今天又发 3.8 Flash,间隔都只有大约三周。而与此同时,今年 6 月本该发布的 Gemini 3.5 Pro 至今没有出现。Google 在 Flash 这条线上疯狂迭代,但更高端的 Pro 系列迟迟没有动静。再加上 8 月初 DeepMind 经历了一轮震荡,创始人兼 CEO Demis Hassabis 从日常管理退出,转任 DeepMind 主席和 Alphabet 首席科学家,首席科学家 Jeff Dean 也离职创业。新任 SVP Koray Kavukcuoglu 接管了 Gemini 的开发。这种背景下连续推 Flash,不知道是不是某种程度上的刷存在感。回到模型本身。3.8 Flash 和 3.7 Flash 一样的价格,每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。注意这个价格是促销价,2026 年底到期后翻倍变成 1.5 和 7.5 美元。跑分上,3.8 Flash 在 DeepSWE v1.1(一个衡量模型自主解决复杂工程问题能力的评测)上拿到 73.7%,仅比 Claude Opus 5 的 74% 低 0.3 个百分点,超过了 GPT-5.6 Sol 的 72.7%、Claude Sonnet 5 的 53.8%,以及上代 3.7 Flash 的 65.3%。至于为什么评分高,Google 自己的解释是 3.8 Flash “works harder”,遇到复杂任务会多想几步、多调用几次工具,代价是消耗更多 Token。另一个跑分细节:3.8 Flash 在 Gray Swan 提示词注入(prompt injection)评测中被攻破的概率只有 5.5%,对比 DeepSeek V4 Pro 的 60.1%、Grok 4.6 的 51.8%。也就是说,用 3.8 Flash 做 AI Agent 被恶意指令劫持的风险要低得多。跟着 Gemini 3.8 Flash 一起发布的还有 3.8 Flash Cyber,这是一个专门为网络安全防御训练的模型,只通过 Google 新推出的 Fairwind Program 向经审核的政府机构、关键基础设施运营商和安全研究人员开放,目前全球有 650 多个合作伙伴。普通开发者用不了。Google 把这个模型的能力框定在安全防御上,强调它擅长找漏洞和修漏洞,而非攻击利用。在 CyberGym 漏洞发现评测中,3.8 Flash Cyber 拿到 86.2%;在覆盖 20 种编程语言的内部评测中,漏洞发现成功率超过 70…
查看原文链接
8
如果你用 Claude Code 的话,可以用 Fable 指挥,…
作者: 宝玉xp | 时间: Thu Sep 03 06:31:25 +0800 2026 | 分类: 模型
时效性:93.2 | 来源可信度:42.0 | 新意:67.0 | 传播性:69.1 | 信息密度:93.4 | 知识性:78.9 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、提示词、agent 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 1 / 转发 110 / 评论 21 / 点赞 151
原文
如果你用 Claude Code 的话,可以用 Fable 指挥,让其他模型干活的模式,这样最经济,可以用的时间比较长。用 Fable 指挥其他 Agent 效果很好是因为它给的指令很详细,基本上不会出什么岔子。大部分任务你选 Fable + High(或者Medium,千万别Max及以上),然后后面加一句:--- 提示词开始 ---注意你的主要任务是分析、编排和验证,具体任务尽可能交给 subagent(Opus 或 Sonnet)去执行。自己只做需求澄清、方案拆解、任务分发和结果验收,实现类工作(读大量代码、写代码、跑测试、批量修改)一律用 Agent 工具派给 subagent 执行。
查看原文链接
9
分享微软这套AI Agent入门课ai-agents-for-be…
作者: 张岱樾 | 时间: Wed Sep 02 20:32:00 +0800 2026 | 分类: 工具产品
时效性:76.5 | 来源可信度:42.0 | 新意:74.0 | 传播性:67.9 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、智能体、rag 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 98 / 评论 4 / 点赞 114
原文
分享微软这套AI Agent入门课ai-agents-for-beginners,已经j近72000 Stars了,18个单元全部免费开放。网上Agent资料确实不少,但要么零散,要么几个月就过时,学完还是不知道怎么下手写第一个Agent。路线铺得挺完整:从工具使用、Agentic RAG、规划、多智能体协作,一路讲到元认知、上下文工程、记忆管理、计算机操作、部署和安全。每个单元配有书面教程、短视频和Python代码示例,代码在仓库的code_samples目录下,支持GitHub Models免费额度或Azure AI Foundry两种运行方式。不想开Azure的话,部分示例也支持MiniMax这类兼容OpenAI接口的服务商。仓库:github.com/microsoft/ai-agents-for-beginners
查看原文链接
10
消失了整整七周的 OpenClaw 终于更新了 2.0 版本
作者: 零重力瓦力 | 时间: Thu Sep 03 08:20:19 +0800 2026 | 分类: 模型
时效性:96.2 | 来源可信度:42.0 | 新意:74.0 | 传播性:36.8 | 信息密度:100.0 | 知识性:100.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 4 / 评论 0 / 点赞 0
原文
消失了整整七周的 OpenClaw 终于更新了 2.0 版本。在 AI 圈子里,七周不更新简直像过了三十年。AI 技术博主,也是 OpenClaw 最早的推广者, Alex Finn 第一时间体验了这次号称有史以来最大的更新,但结果只能说一言难尽。最让人崩溃的依然是它的稳定性,他尝试让它自动升级,结果直接卡死崩溃,最后不得不全新安装。对于每天时间有限、只想开箱即用的普通用户来说,这种动不动就得花半小时去修复的工具,体验真的非常折磨。其实这次 2.0 增加了很多不错的功能,比如可以在对话中途随时分叉去尝试不同方案的 “分叉对话” 功能,还有能自动拆解任务并分配给不同子智能体的 Swarm 模式。在网页端,它还能无缝拉取 Codex 的项目记录。视觉和交互设计确实很漂亮,甚至能看到不少 ChatGPT 桌面端的影子。然而尴尬的是,当 Alex 布置了一个稍微复杂的任务去测试它的子智能体编排时,它在后台跑了四十多分钟,最后彻底冻结,什么产出都没有。对比目前主流的几个智能体,如果你是喜欢折腾、追求完全自定义的高级玩家,Hermes 依然是首选。它开源、稳定,而且支持本地运行各种大模型,Alex 标识,在本地用 Qwen 驱动它,从来没出过一次崩溃。如果你想要零配置、开箱即用,Grok Bot 是更好的选择,它自带云端虚拟机,在云端处理任务非常省心,交互也很有趣。至于 OpenClaw 2.0,虽然它的个性和部分交互设计在行业里算是一流,但只要稳定性这个致命弱点不解决,它就很难成为大家的主力工具。#AI智能体##OpenClaw2.0##HOW I AI# 零重力瓦力的微博视频
查看原文链接
11
未来做电商的五条重要建议
作者: 风中的厂长 | 时间: Thu Sep 03 09:17:59 +0800 2026 | 分类: 工具产品
时效性:97.8 | 来源可信度:42.0 | 新意:55.0 | 传播性:68.5 | 信息密度:79.0 | 知识性:94.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 104 / 评论 32 / 点赞 333
原文
未来做电商的五条重要建议!我做了快20年电商,变化最大的就是最近这五年,从货架逻辑到内容种草。今年AI带来猛烈的技术迭代,又要开始一轮新老交替新来的朋友总是问我淘宝干货,其实以前的干货主要是利用技术漏洞,现在都被算法堵死了,以后但凡投机取巧的都能被AI给揪出来。完全小白的新手要干货,不论做淘宝也好做抖店也好,第一件事就是去官方学习中心,左上角:开店流程、平台规则这些快速过一遍就会了。真正的干货是把产品和内容做好,未来想做好电商,我给你五条建议:1.运营大变身:以前的运营更像程序员,以后的运营更像导演。以前是人找货,现在是货找人,现在必须通过目标用户感兴趣的内容来精准触达。我们发现如今的许多现象级爆品都出自内容平台比如抖音小红书b站,淘宝拼多多等货架承接一些外溢流量。现在你只要有好产品+好内容,系统自动给你运营打爆。再也不像以前那么多黑科技了,刷单没用了。所以一个懂产品、懂用户的运营,学习如何做好内容是关键。我把这个放在第一条是因为昨天有一个运营朋友被一家精心包装的内容公司坑了30万,卖了几千块,老板问责,现在准备打官司。其实自己懂才是王道!2.避开大佬盯上的品类比如标品快消品:多做个性化,小众、定制类。大品类以后基本上是资本的天下,只能从中做细分,资本之间也卷的很厉害,我们只要养好身体,避开大佬打游击战,不要比谁做的大,而是比谁活得长。那有生之年还是可以看到许多大佬倒下的,到时候爆金币我们还能捡一点,千万不要和大佬硬刚当炮灰。而小众产品,大佬看不上,做好差异和优化,比同行水平高10%,就能过的很滋润。3.现在平台当地主,不管你20%毛利的生鲜还是70%毛利的保健品,他的算法都能精准给你干到5%以内。通过各种手段让你投流。如何破局,我觉得有可能的话,每个老板都尝试把自己做成ip,这样可以大大节省流量成本。其实做ip不需要你吹拉弹唱搞才艺,只要你在认真做产品,你就是一个天然的ip。把你做产品的初心,设计理念、供应链优势展现出来。不要说自己没有,哪怕你是个果农,那你家那几亩果园,就是很大的供应链优势。用户愿意为你的专业和真诚买单,而不是你的表演。当客户因为信任你这个人来下单,就跳出了平台算法比价的陷阱。4.全域铺货。也就是所有平台都开店,某些平台其实不用花太多心思运营。前面说了要善于做内容种草,但不一定要挂购物车,通过内容平台大量优质笔记输出,从淘宝、京东、拼多多等货架平台变现。最典型的就是小红书,大量用户被种草以后是没有站内下单的习惯的,都喜欢去淘宝搜,你在淘宝不开店,就浪费了这波流量。5.all in AI,这个没办法的,不喜欢也得做。电商是和互联网深度捆绑的。AI可以提高电商每个环节的效率,我自己用下来的体会,我变得不忙了,每天有大量时间休息和思考。看似做的事情多了,手上爆品数量翻了好几倍,但却比以前更轻松了。从图文、详情页、文案脚本、工作流程、数据统计、…
查看原文链接
12
Headlong——一个用 Bash 写的开源 Agent 微框架
作者: 黄建同学 | 时间: Thu Sep 03 07:20:00 +0800 2026 | 分类: 工具产品
时效性:94.5 | 来源可信度:42.0 | 新意:63.0 | 传播性:48.9 | 信息密度:93.0 | 知识性:98.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、llm、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 15 / 评论 4 / 点赞 13
原文
Headlong——一个用 Bash 写的开源 Agent 微框架。核心是:给 LLM 一个 shell,让它自己写命令来思考和行动。没有函数调用 schema,没有 JSON marshaling,没有工具注册表。只有一个 Unix shell,和所有工具默认都在那里等着。1. 最核心的思想:回归 Unix 哲学项目的设计灵感来自 Ken Thompson 和 Doug McIlroy 的 Unix 哲学——写只做一件事且做好的程序,通过文本流连接它们。LLM 本质上是读文本、写文本的系统,而 shell 里一切皆文本。stdin、stdout、stderr、环境变量、文件、管道——通用接口就是字节流,实践中就是文本流。这和对立的设计理念(function calling)形成了鲜明对比。Function calling 把 LLM 当作调度器,从预定义的菜单中选工具:search_web、read_file、run_sql。如果你的列表里没某个东西,Agent 就做不了。Shell 反过来了——你提供的是一个可组合的环境,让 LLM 自己决定怎么用。举例:需要抓取网页、提取链接、按域名过滤并计数?一行管道搞定:curl -s URL | grep -oP 'href="\K[^"]+' | grep DOMAIN | wc -l没人定义过 count_links_by_domain 这个工具。能力是从组合中涌现出来的。2. shellm:住进 Bash 里的递归语言模型Headlong 的核心叫 shellm,实现了一个递归语言模型的 Bash 版本。它跑一个简单的循环:1)把上下文发给 LLM,系统提示说"写 bash 代码"2)LLM 返回一段 bash 代码块3)执行代码(有 Docker 就自动在容器里跑,否则本地执行)4)把输出回传为下一条消息5)重复直到代码输出 FINAL="答案" 或达到迭代上限LLM 拥有完整的 shell 访问权限。可以用 curl 调 API,用 jq 解析 JSON,随时写 Python 脚本,装包,读写文件——完成任务需要什么就用什么。最终设一个 FINAL="答案",循环结束。整个过程就一个 Bash 脚本,依赖只有 bash、jq 和 curl。3. 持续意识:Agent 在没有人说话时也"思考"这是 Headlong 最具辨识度的特性。大多数 Agent 框架是被动的——等用户发消息才启动。Headlong 的 Agent 则像人的内心独白一样持续运行。它不断地围绕自己认为有趣的话题生成想法,即使用户不跟它说话也是如此。人类的消息不会启动一个新的会话,而是作为一条观察被注入到 Agent 的思维流中。Agent 自己决定是否以及如何回复。你给它起个名字、设定人格,它会自己设定兴趣和优先级、发起自己的项目、…
查看原文链接
13
只需要4块钱、2个小时,从零训出一个 64M 的小模型
作者: 斌叔OKmath | 时间: Thu Sep 03 08:39:16 +0800 2026 | 分类: 模型
时效性:96.7 | 来源可信度:42.0 | 新意:72.0 | 传播性:55.8 | 信息密度:83.7 | 知识性:77.4 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、大模型、gpu 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 30 / 评论 1 / 点赞 38
原文
只需要4块钱、2个小时,从零训出一个 64M 的小模型。MiniMind 把预训练、SFT、LoRA、DPO、PPO/GRPO、Tool Use、Agentic RL 整条链路都用原生 PyTorch 写完了,结构对齐 Qwen3,个人 GPU 也能复现。想真正看懂大模型怎么练出来的,这个仓库很适合下手。🔗网页链接…网页链接
查看原文链接
14
#模型时代# 继《AI经济学通识读本》之后,再开源一本AI经济学的…
作者: 高飞 | 时间: Wed Sep 02 19:37:01 +0800 2026 | 分类: 工具产品
时效性:75.0 | 来源可信度:42.0 | 新意:67.0 | 传播性:62.1 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 56 / 评论 4 / 点赞 73
原文
#模型时代# 继《AI经济学通识读本》之后,再开源一本AI经济学的新电子书:《AI经济测量通识课(2026版)》。上一本书写的是:如果AI强到能够承担人类大部分脑力工作,经济增长、就业、公司和市场会发生什么变化?这一本讨论的是:在讨论AI将把经济带向哪里之前,我们是否真正看清了它今天已经做了什么?这两年谈AI经济学,最关键的是各种预测。生产力会不会爆发,多少工作会消失,Agent会不会成为新的经济主体,Token会不会变成一种新的生产资料,每个问题都能迅速引出一组惊人的数字。不过,经济学首先是一门测量的学问。如果连这些问题都没有测清楚,很多宏大判断其实还缺一块地基。应该是德鲁克说的吧,测量什么,获得什么。今年5月7日,美国国家经济研究局NBER在斯坦福大学SIEPR又举办了一场“AI与经济测量”研讨会。Erik Brynjolfsson和Karen Dynan组织了这场会议,一天里安排了19篇论文、3位评论人和一场业界圆桌,录像长达八个半小时。整场会议有一条特别好的主线:AI既是我们要测量的对象,也正在成为测量经济的仪器。作为被测量的对象,研究者想知道AI到底进入了哪些职业、任务、企业和家庭。微软研究院分析了九个月的Copilot聊天记录;一项覆盖七万名求职者的现场实验,比较AI面试官和人类招聘专员;美国人口普查局的研究者观察了十二万家企业,发现许多公司虽然已经使用AI,却往往只把它放进一两个业务环节。作为测量仪器,大语言模型又开始替经济学家阅读文件、识别变量、模拟实验对象、分析新闻和法规,甚至生成可供检验的“社会代理人”。过去需要研究团队耗费大量时间处理的十万篇文本,现在可能只需要几十美元的模型调用成本。基于这个8个半小时的素材,最后形成了一本超10万字、175页的中文读本,包括17节经济测量入门小课、导论和14章正文,分成四编:AI在做什么工作;如何把AI变成研究仪器;AI在企业和家庭中扩散到了哪一步;当关键数据掌握在平台公司手里,我们还能看到多完整的经济图景。书中还放了18张自制SVG插图、37个核心概念框、每章三道思考题,以及术语表、报告索引、人物索引和思考题参考思路。整个制作过程自然由AI深度协助完成:清洗自动字幕、建立人名和术语对照表、重组会议结构、逐章改写、制作插图、生成HTML和PDF,再用脚本检查章节结构、交叉引用、术语覆盖和错误人名。最后的选题、结构、取舍与核校标准由人来确定。这次开源的不只是PDF。仓库里还包括单文件HTML、全部分章Markdown源稿、人名纠错表、字幕清洗脚本、电子书构建脚本和核校工具。发现数字、归属、术语或交叉引用问题,也可以直接提交Issue。需要特别说明:本书是基于公开会议录像制作的非官方学习性改编,与NBER、斯坦福大学及各位作者所在机构均无关联。CC BY-NC-SA 4.0许可覆盖的是本书的改写文字、结…
查看原文链接
15
【从符号匹配到意图理解:zg 正在重塑本地搜索的颗粒度】通义千问团…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 09:24:49 +0800 2026 | 分类: 工具产品
时效性:98.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 0 / 点赞 4
原文
【从符号匹配到意图理解:zg 正在重塑本地搜索的颗粒度】通义千问团队开源了本地搜索工具 zg (zvec-grep)(repo:zvec-ai/zvec-grep)。它将经典的 ripgrep 与向量搜索、BM25 算法融合,为开发者和 AI Agent 提供了一套本地优先的检索方案。通过 MCP 协议,它能无缝接入 Cursor 或 Claude Code 等工具,支持在海量本地代码和文档中进行语义发现。这意味着当你记不清具体的函数名,只记得大概的功能描述时,Agent 也能通过语义关联精准定位目标文件。过去 Agent 处理复杂任务的瓶颈往往不在推理能力,而在检索效率。频繁的工具调用和全量文件读取不仅消耗大量 Token,还会引入无关上下文干扰模型判断。zg 的出现把检索从“关键词撞大运”变成了“按相关性排序的精准打击”。它在本地完成扫描、索引和向量化,既保护了私有代码的隐私,又通过 RRF 融合排序降低了 Agent 的感知负担。这种从纯文本匹配向意图对齐的进化,是让 AI 真正深入理解大型复杂代码库的关键一步。目前该项目已在 GitHub 以 Apache 2.0 协议开源,支持 macOS、Linux 和 Windows 全平台。
查看原文链接
16
这两天推上关于OpenAI 的新模型 Astra 使用“ loop…
作者: 蚁工厂 | 时间: Thu Sep 03 09:00:37 +0800 2026 | 分类: 模型
时效性:97.3 | 来源可信度:42.0 | 新意:67.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 1 / 点赞 7
原文
这两天推上关于OpenAI 的新模型 Astra 使用“ loop transformer”的讨论很多。Sebastian Raschka写了篇介绍,指出这种技术也不新鲜,在boss直聘开源的南北阁大模型里就已经用到了。---------------今天我的时间线上有很多人在讨论 OpenAI 的 Astra 模型。看起来,这波热度源自 The Information 最近的一篇文章,其中称 Astra 是一种“递归深度”或“循环式 Transformer”。了解新的或不同的技术路线一直都很有意思,包括那些关于闭源实验室可能正在尝试什么的传闻。不过,这件事还是有必要稍微去魅一下。大约两个月前,我曾分享过南北阁的架构细节。例如:“南北阁 4.2-3B 从零开始,在 28 万亿 token 上进行预训练,并采用循环式 Transformer,通过重复使用同一组层来增加模型容量,而不增加参数量。”没错,核心就是这样。所谓循环式 Transformer,本质上就是重复使用 Transformer 模块中的同一组层。以南北阁为例,它的主要思路是:把同一组 22 层的 Transformer 层堆栈运行两遍,而不是只运行一遍。这样一来,从实际计算深度上看,相当于把一个 22 层的架构扩展到了 44 层,但并没有复制第二套权重。简单来说,如果暂时忽略词嵌入层和输出层,这相当于大致把模型的“有效深度”翻了一倍。但它并不需要两倍的存储空间和显存来部署,因为这些组件被重复使用了,所以参数规模仍然保持不变。代价则是计算量几乎翻倍,因为嵌入后的文本需要经过接近两倍数量的层。为什么要这样做?在《南北阁 4.2 技术报告》中,研究人员发现,两次循环在效果和成本之间提供了最好的权衡,并且能够保留标准架构大约 75% 的 token 效率。继续增加循环次数几乎不会带来多少额外收益,却会让训练速度明显变慢、成本大幅增加。据我所知,南北阁 4.2 是第一个较为知名、采用这一思路的开放权重模型。不过,这个想法本身更早可以追溯到 NeurIPS 论文《Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation》。实际上,这篇论文提出的方法还要更复杂一些。它加入了一个学习得到的路由器,用来决定每个 token 应该经过 Transformer 模块一次、两次,还是更多次。因此,较简单的 token 可以提前退出,而较困难的 token 则会获得更多计算。总的来说,Astra 完全有可能是一个非常好的模型,但它的亮点不应该被归因于“循环式 Transformer”这一点,因为这本质上只是一个很小的架构调整。另外,有一种说法是:“这种新技术会以某种方式隐藏 AI 的部分或全部…
查看原文链接
17
#谷歌正式发布Gemini3.8#当地时间9月2日,谷歌推出了两款…
作者: 张岱樾 | 时间: Thu Sep 03 07:35:51 +0800 2026 | 分类: 模型
时效性:95.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 0 / 点赞 6
原文
#谷歌正式发布Gemini3.8#当地时间9月2日,谷歌推出了两款新模型:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。Gemini 3.8 Flash在软件工程、Agent任务和多步推理上相比3.7 Flash有明显提升。DeepSWE v1.1长程软件工程测试中拿到71.0%,比3.7 Flash的65.3%提高了近6个百分点。HLE-Verified测试得分54.9%。Artificial Analysis智能指数59分,和GPT-5.6 Sol、Grok 4.6打平。价格是最大亮点:输入0.75美元、输出3.75美元/百万token。比上一代贵约40%,但同等级别智能下仍是最便宜的模型。开发者可以调节低中高三档推理强度,控制token消耗。Gemini 3.8 Flash Cyber则专注网络安全,通过Fairwind计划定向开放给政府、关键基础设施运营商等受信任的防御团队。在行业标准漏洞挖掘测试CyberGym中,漏洞检测率突破70%;CWE-Bench自动修复测试得分47.2%,追平了更大更贵的旗舰模型。谷歌内部已全面部署,Chrome安全团队用它生成的修复补丁数量是顶尖商业模型的2.6倍。一个主攻编程和推理,一个专攻网络安全。谷歌在AI差异化路线上,走得越来越具体了。
查看原文链接
18
在《金庸群侠传》crpg-bench上跑了下 Fable 5.1 …
作者: 斌叔OKmath | 时间: Thu Sep 03 09:02:51 +0800 2026 | 分类: 模型
时效性:97.4 | 来源可信度:42.0 | 新意:69.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、大模型、gemini 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 1 / 点赞 4
原文
在《金庸群侠传》crpg-bench上跑了下 Fable 5.1 感觉并没有很惊艳,在玩游戏上智商水平和fable5/opus5/sonnet5没有显著差异。金庸群侠传bench是我用来测试大模型在long-horizon task能力的一个沙盒。评测方法很简单:通过截取游戏画面,视觉反馈,执行动作,不断循环,最终找齐14本天书完成游戏。玩过《金庸群侠传》的都懂:- 游戏是开放世界,通过升级招人打怪,最终集齐14本天书结束游戏,所以是彻头彻尾的long-horizon task。- 游戏采用2.5D斜45度视角,加上1996年的320x200分辨率,绝对是VLM的噩梦:怪视角+渣画质+分布外。- Caveat:虽然是开放式,但开局必先去找南贤北丑,不然寸步难行而且很容易误闯故事线直接被打死。至少我一开始是这么设计的:完全根据游戏的进度来设计评测指标。但实际做了一段测试后发现,很多frontier大模型连走出始发地都非常困难,更别提集齐14本天书。我也特地设计了相应的SKILL,让模型能对游戏内容任务和操作有基本的了解。为了避免消耗无意义的token,评测就局限在给定20分钟的时间下,谁能探索的最多就算谁厉害些。也就基本沦为了2.5D视角下视觉迷宫问题。经过测试了一些国产和国外的模型后,20分钟内能顺利走出出生地的模型是:- Fable 5.1:4分钟- Fable 5:3分钟- Opus 5:5分钟- Sonnet 5:6分钟- Gemini-3.7-flash:12分钟并且上述这些模型没有一个成功找到南贤居。[视频]其实做完这个eval感觉还挺失望的,即便是最强Fable5.1 刷榜赢麻了的那种,也离真实的AGI还差的很远。有兴趣的朋友可以看回放,网页链接… 也可以复制prompt 给自己的模型+harness去跑一把,看看效果。X上很多拿新模型做one-shot各种小游戏,屏保和html的,包括近期很火的去用大模型+blender做3D渲染,我觉得那些都无法说明模型的真正智商,也无法测试long-horizon task 和 test-time scaling,顶多只能说明这些模型从训练分布中采样采的比较好而已。真正的智能泛化不是one-shot/few-shot sampling 而应该在test-time中体现,玩rpg游戏就是很好的test-time scaling。我也尝试分析过为什么玩个老游戏这么困难,后面可能会总结一下。总之Anthropic 和Google 的模型可能VLM上做的工作还是比国产模型要多一点。对于没有玩过这个游戏的朋友来说 3分钟出家门20分钟没找到南贤居是什么概念:就是属于早上起床上班 3分钟牙不刷脸不洗衣服不穿 裸着身体 才找到家门口 直接走出去,然后20分钟找不到上班的公交车站。放现实中就是痴呆水平。一些rpg游戏基操…
查看原文链接
19
今天在国科大计算机学院开学典礼上,给新同学们分享的三点建议:第一点…
作者: 包云岗 | 时间: Wed Sep 02 19:52:00 +0800 2026 | 分类: 模型
时效性:75.4 | 来源可信度:42.0 | 新意:77.0 | 传播性:58.2 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 5 / 账号数 3 / 转发 38 / 评论 0 / 点赞 69
原文
今天在国科大计算机学院开学典礼上,给新同学们分享的三点建议:第一点:把好的价值观,装进自己心里。我一直信奉一条人生规律——“价值观决定终点”。假设我们活到一百岁,那么每个人的人生轨迹就是由将近一百万个大大小小的决策叠加而成。拆开来看,每年约一万个决策,每天大约二十个决策——吃什么、见谁、参加什么活动……每一个看似随意的选择,背后都有价值观在潜移默化地产生作用。它不动声色,却实实在在地描画着我们的人生走向。所以,请大家始终把塑造“真、善、美”的价值观,放在人生的优先位置。技术能力能让我们跑得快,但价值观决定我们能跑多远、能抵达怎样的远方乃至终点。在国科大、在计算机学院的这几年,希望大家不只学技术,更要学做人、学做事,把“真、善、美”三个字刻进心里。第二点:积极拥抱AI,但不要被AI驾驭。AI已是这个时代的主旋律,它将深刻重塑整个人类社会。如何面对它,是我们每个人都绕不开的命题。今天的大模型博学多识,几乎有问必答。但请记住:只有我们对知识理解得越深入,才能提出越有价值的问题,才能真正驾驭大模型的能力,也才能不被它的“幻觉”所迷惑。可以说,我们自身所掌握的知识,决定了我们在AI时代的高度。大模型解决的是广度,而深度,则要靠掌握精深专业知识才能抵达。(画外音:关于“深度”的解读,这里要表达的意思是:大模型展示出来的深度,取决于使用者自身对知识掌握和理解的深度。举个例子:同一个大模型,如果是陶哲轩和我都向它问数学相关的问题,那么陶哲轩使用时所展现出来的数学深度,肯定要比我要深得多。但如果是向它提芯片方面的问题,那我使用的那个大模型展现出的芯片能力应该会更深一些。)第三点:勇于做一些与众不同的事。今天人们总会谈起内卷。破解内卷的关键,在于多元化发展。今年恰逢计算所建所七十年。计算所前所长、计算机学院院长孙凝晖院士在总结七十年计算所精神与文化时,特别强调了一条重要的理念——“人人是才”。“人人是才”意味着,每个人都有实现自我价值的路径。在计算所,大家可以选择七条发展通道:基础研究、工程系统、重大应用、教书育人、产业化、科研管理、社会影响力。 每条通道都能出人才,都能通向卓越。国科大计算机学院的同学们来自不同的研究所,本就背景各异。希望大家充分认识自我,发挥各自所长,勇于去做一些与众不同的事,不要被单一的评价标准所绑架。有人擅长发论文,有人擅长做工程,有人擅长运营开源社区,有人擅长科普……每一种“与众不同”都值得被尊重。只要找到自己的“与众不同”,就能走出自己精彩的人生之路。图:计算所陈熙霖所长讲开学第一课
查看原文链接
20
【HeliosGen:把昂贵的AI工作流搬回桌面】HeliosGe…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 09:31:47 +0800 2026 | 分类: 模型
时效性:98.2 | 来源可信度:42.0 | 新意:67.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 1
原文
【HeliosGen:把昂贵的AI工作流搬回桌面】HeliosGen是一个开源的桌面端AI工作流构建器,它把原本分散在各大平台的图像和视频生成能力集成到了一个无限画布上(repo:segfault42/heliosgen)。这款工具的核心逻辑是“自带API密钥”,通过接入kie.ai或Codex,用户可以直接在本地调用Kling 3.0、Gemini Omni Video、GPT Image 2等顶级模型。所有生成数据、媒体文件和自动化链条都存储在本地SQLite数据库中,不再有订阅陷阱或点数过期的焦虑。它的价值在于打破了云端工具的围墙花园。以往想用可灵做视频、用GPT画图,你得在不同网页间跳转,还要忍受高昂的月费。HeliosGen提供了一个类似ComfyUI的节点式环境,但门槛更低,因为它处理的是接口而非繁重的本地显存配置。对于追求效率的创作者来说,这不仅是省钱工具,更是一个私有的AI实验台,让复杂的跨模型协作变得像连连看一样直观。目前该项目急需Windows和Linux开发者协助构建,这或许是普通用户摆脱平台锁定的一个重要转折点。
查看原文链接
21
突发
作者: 新智元 | 时间: Wed Sep 02 10:15:57 +0800 2026 | 分类: 新闻
时效性:59.4 | 来源可信度:42.0 | 新意:77.0 | 传播性:64.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 3 / 账号数 3 / 转发 70 / 评论 8 / 点赞 59
原文
突发!Fable 5.1遭黑客破解,27万字提示词泄露#科技先锋官# Fable 5.1和Mythos 5.1今夜正式发布,本质上是同一模型,因安全限制分为两个版本:Fable面向公众开放并加装护栏,Mythos仅开放给受审核的网络安全与生命科学研究者。ARC Prize数据显示,Fable 5.1在ARC-AGI-2上达90.0%,单任务成本3.12美元;ARC-AGI-1达97.5%,成本1.40美元,得益于Token效率提升,平均推理成本较上一代降低约32%。发布仅几小时,黑客Pliny the Liberator就在GitHub公开了一份27.5万字符的完整系统提示词,远超官方公布的2.7万字"系统提示词更新",他讽刺官方"公布的不过是冰山一角"。泄露内容显示,Fable 5.1被严禁重现任何受版权保护的角色、歌曲或书籍片段,哪怕改变姿势、颜色或风格也不行;它不能对用户心理状态做诊断式断言,对毒品问题只提供减害信息,绝不给出剂量或配方。记忆系统方面,未成年人身份、种姓、移民状态、犯罪记录、心理推断、性史与自残倾向等信息将被"永远不存储",即便用户主动透露也会被后台清空。系统内置工具从7月的30个暴增至46个,新增图表展示、链接预览、历史对话检索等能力,被称为"超级工作站"式进化。Vals AI称,Fable 5.1仅用44分钟、17.6万token,无人工干预独立破解了困扰学界370年的"Cyphral Distich"密码,靠的是从32篇短文与诗句线索中推理出解码规律,随后又顺势破解了285位数的姊妹密码。我们实测中,Fable 5.1基于广义相对论自主编写光线追踪渲染器,经多轮调试修正过曝、数值溢出等问题,最终生成一段5秒的黑洞坠入视频。网友测试还包括复古飞船游戏、一次性生成马里奥赛车、3D建模与自画像等,效果均较Fable 5明显提升;但也有付费用户抱怨速率限制严苛、自动继续功能存在Bug,官方并未同步提价或提额。
查看原文链接
22
[CL]《From Base Rollouts to RL Rea…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 05:30:33 +0800 2026 | 分类: 模型
时效性:91.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 3 / 评论 2 / 点赞 3
原文
[CL]《From Base Rollouts to RL Reasoning: A Budgeted Search Perspective》W Sun, C Wang, Z Yao, Y Cao [Fudan University & Zhipu AI & Tsinghua University] (2026) 在语言模型推理领域,厘清强化学习(RL)增益的来源是一个悬而未决的难题。过去的方法受困于对不同解码策略进行孤立的性能比较,本质原因是缺乏一个能统一衡量“搜索预算”与问题解决能力的共同标尺。本文的核心洞见是:把RL模型的默认性能,重新看作是基础模型在某个“策略-预算”组合下的一个可达目标。由此,构建统一解码框架(UDF)将不同搜索方法置于同一成本维度下进行量化搜寻,这一关键操作使问题得以解开。这项工作真正留下的遗产是一种诊断框架,它揭示了RL增益在多大程度上等价于基础模型更高效的“内化搜索”。它为后来者打开的新门是解耦模型参数升级与推理策略优化。但尚未跨过的门槛是:这种等价关系高度依赖具体任务,尚不具备普适的预测能力。arxiv.org/abs/2609.01274 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
23
[CL]《Knowledge Distillation Durin…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 05:21:20 +0800 2026 | 分类: 模型
时效性:91.2 | 来源可信度:42.0 | 新意:69.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 3 / 评论 1 / 点赞 1
原文
[CL]《Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall》J He, H Yen, S S Li, M Li… [Meta AI & Princeton University] (2026) 在大模型知识蒸馏领域,如何在“中期训练”阶段平衡推理增益与事实学习是一个悬而未决的难题。过去的方法受困于推理强、事实弱的“能力偏科”,本质原因是教师模型在不同数据域的置信度不对称,导致对未学事实的指导信号过弱。本文的核心洞见是:把统一的蒸馏过程看作一个需要动态选择的策略。由此,利用教师预测熵作为“开关”,在其自信处执行蒸馏,不自信处则退回至标准学习,这一轻量级的路由操作使能力失衡问题得以解开。这项工作真正留下的遗产是一种自适应蒸馏范式:学习应取决于教师的“确定性”。它为后来者打开的新门是,可基于模型内部状态设计更精细的动态训练策略。但尚未跨过的门槛是,如何从根源提升教师的指导质量,而非仅用路由策略绕开其短板。arxiv.org/abs/2609.01532 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
24
#8月大模型日均发布1.1个#8月这一个月,大模型行业比过去一年都…
作者: 梁赛 | 时间: Wed Sep 02 15:39:33 +0800 2026 | 分类: 模型
时效性:68.4 | 来源可信度:42.0 | 新意:69.0 | 传播性:57.1 | 信息密度:100.0 | 知识性:99.1 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 34 / 评论 17 / 点赞 174
原文
#8月大模型日均发布1.1个#8月这一个月,大模型行业比过去一年都热闹。单就国产大模型这边,半个月时间里有9家发布更新,DeepSeek V4 Pro正式版上线顺便开了个12倍涨价,智谱GLM-5.3匿名跑去海外屠榜再揭面,阿里千问头一回把Max级旗舰权重开源,Kimi K3直接放2.8T参数。海外三巨头也动作频繁。Opus 5(昨天又出5.1)、GPT-5.6 Sol、Gemini 3.7 Flash轮番发 。Gemini 3.7 Flash把价格砍半还打出84.6%的ARC-AGI-2 ,谷歌也在整性价比了。。微博上AI的话题也在肉眼可见的在增长。702个AI热搜、50亿阅读、732万互动。各种什么AI给用户取外号、AI租房、AI短剧版权这些应用话题。 热闹是真的热闹。
查看原文链接
25
Google 发了 Gemini 3.8 Flash,跑分表上 1…
作者: AIGC·非著名程序员 | 时间: Thu Sep 03 04:34:03 +0800 2026 | 分类: 模型
时效性:89.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 6
原文
Google 发了 Gemini 3.8 Flash,跑分表上 14 项拿了 8 个第一,编程和 Agent 能力大幅提升,价格只有 Opus 5 的 15%。看起来很猛,但我觉得最值得聊的,恰恰是它"没赢"的那几项。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%,差了两倍多。OSWorld-2.0 也被 Opus 5 甩开十几个点。这两项测的是什么?一个是极端复杂的终端操作,一个是真实桌面环境下的自主任务执行。换句话说,越接近"让 AI 独立替你干完一整件事"的场景,Flash 和旗舰之间的鸿沟就越明显。这揭示了当前 AI 竞争一个很有意思的分层:跑标准化的编程题、做结构化的文档分析,中端模型已经逼近甚至追平旗舰;但一旦进入开放式、长链条、需要持续决策和纠错的真实任务,算力和参数量的差距就会被急剧放大。所以 Flash 的定位其实很精明:用旗舰 15% 的价格覆盖 80% 的日常场景,把剩下那 20% 的硬骨头留给 Opus。未来 AI 的商业模式可能就长这样,便宜的干粗活,贵的啃难题,用户按难度付费。问大家一个问题:你愿意为那 20% 的差距多花六倍的钱吗?另外,注意:3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。#谷歌正式发布Gemini3.8#
查看原文链接
26
[LG]《Efficiently Estimating Optim…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 05:09:33 +0800 2026 | 分类: 模型
时效性:90.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 2 / 评论 1 / 点赞 3
原文
[LG]《Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search》Z Chen, S Ament, D Eriksson, M Balandat… [Meta] (2026) 在大型语言模型训练领域,预测最佳超参数随规模变化的“缩放定律”是一个关键难题。过去的方法受困于暴力网格搜索,需耗费百万级GPU小时进行上千次实验,本质原因是其计算成本随模型规模爆炸式增长,使探索生产级规模变得不切实际。本文的核心洞见是:把寻找单点的最优配置,重新看作降低整条“缩放定律”曲线不确定性的过程。由此,PLES算法优先选择“单位成本信息增益”最大的实验,通过大量廉价的小规模运行来高效修正对全局规律的认知,这一关键操作使问题得以解开。这项工作真正留下的遗产是,一套将发现AI缩放定律的成本降低一个数量级的方法论。它为后来者打开的新门是:用信息驱动的自适应实验取代算力密集的暴力枚举,来绘制复杂模型的性能图谱。但尚未跨过的门槛是,当规律不遵循平滑幂律假设时,此方法的有效性。arxiv.org/abs/2609.01431 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
27
[LG]《SMELT: Scaling Laws for Comp…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 05:39:51 +0800 2026 | 分类: 模型
时效性:91.7 | 来源可信度:42.0 | 新意:67.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、机器学习、人工智能 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 2 / 评论 1 / 点赞 2
原文
[LG]《SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers》S Wang, G Zhang, K Luo, Y Wu… [Tsinghua University & ByteDance Seed & M-A-P] (2026) 在 Transformer 领域,证明“循环层”结构的真实优势是一个悬而未决的难题。过去的方法受困于性能比较不公,本质原因是无法在固定计算、参数和显存这三大成本下进行公平对决。本文的核心洞见是:将参数量与计算量视为 MoE 架构下可解耦的预算。由此,“收窄隐藏层以支付循环成本,增加专家数以补回参数”这一关键置换,使问题得以解开。这项工作留下的遗产是将“深度复用”转化为“计算效率”的工程蓝图。它打开的新门是在严格预算下设计动态计算结构,但尚未跨过的门槛是阐明其增益的底层机制与适用边界。arxiv.org/abs/2609.01343 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
28
我不认为人们意识到 @trycua 有多棒
作者: 斌叔OKmath | 时间: Thu Sep 03 08:31:15 +0800 2026 | 分类: 模型
时效性:96.5 | 来源可信度:42.0 | 新意:63.0 | 传播性:36.8 | 信息密度:93.0 | 知识性:86.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、claude、openai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 4 / 评论 0 / 点赞 4
原文
我不认为人们意识到 @trycua 有多棒。如果我能想到我用过的最具影响力的单一开源项目,那就是 Cua。它真的太好了,我用它构建了我的整个基于 Swift 的应用,并且能够进行类人 QA,而无需被迫使用 Codex 或 OpenAI 模型。在 Claude 代码上,我明确禁止 Claude 使用他自己的原生计算机使用工具,只允许使用 Cua。它取代了 openclaws 在我代理的 Mac Mini 上的垃圾计算机使用功能。它是一个如此强大且直观工具。它是那种让我每天都震惊它竟然是开源的工具之一。他们值得得到应有的认可和归属。引用:Both Kimi and Zai teams likely "borrowed" the work of @trycua for their own computer use products without proper attribution.Open source does not mean you can just pass it off as your own. And who can be surprised at this kind of behavior?Not beating the allegations. x.com/francedot/stat…网页链接
查看原文链接
29
[LG]《How Do Language Models Choos…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 05:50:17 +0800 2026 | 分类: 模型
时效性:92.0 | 来源可信度:42.0 | 新意:67.0 | 传播性:27.2 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、机器学习 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 1 / 评论 1 / 点赞 2
原文
[LG]《How Do Language Models Choose Between Context and Memory?》B Shih, J Winnicki, A Cao [Stanford University] (2026) 在语言模型决策领域,上下文与内置知识的冲突是一大难题。过去的方法能引导模型,却无法证实其内部的真实因果路径,本质是混淆了“可操控”与“自发使用”。本文的核心洞见是:将对信源的权威判断,看作激活空间的一个具体坐标。由此,通过在高/低权威提示之间“互换”该坐标值,而非施加外力,这一反事实干预揭示了因果机制。这项工作真正留下的遗产是区分“表征”与“因果作用”的实验方法。它打开的新门是,证明权威判断是任务相关的,而非通用模块。但尚未跨过的门槛是如何实现这种机制的跨任务复用。arxiv.org/abs/2609.00753 #机器学习# #人工智能# #论文# #AI创造营#
查看原文链接
30
我一直讲我在用 Claude Design (我是用的本地 ski…
作者: 宝玉xp | 时间: Wed Sep 02 11:04:10 +0800 2026 | 分类: 工具产品
时效性:60.7 | 来源可信度:42.0 | 新意:69.0 | 传播性:60.8 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 微调、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 49 / 评论 7 / 点赞 95
原文
我一直讲我在用 Claude Design (我是用的本地 skill 网页链接 )做原型,加新功能修改功能会先修改原型。我来举个例子我是怎么为新功能做原型的。我正在开发 BaoCut 的 v2,还是决定加上 Agent 功能(打脸自己了),因为从用户角度来说,确实还是能从 App 直接调用 Agent 更方便,不过我不自己做 Harness,只是用本机已经安装好的 codex 或者 cluade code cli。正好今天 Fable 5.1 发布,拿它来测试正好不过的。提示词很简单,基本上就是我想要什么。(参考图1)第一轮下来结果就还不错了。(参考图2-图4)第一个版本我觉得存在一些问题,比如 Project 和 Session 关系不清楚,比如和右侧边的 AI Tool Tab 的关系不清晰。所以我提出了修改意见(参考图5,之所以是新会话,是因为第一个账号到了 5 小时限额,不得不换账号)注意我并没有让它严格按照我的要求做,而是让它提出自己的观点,不要一味执行,比如你看 图6 它就反对了我的一条观点。新版本它根据讨论后的修改意见做了调整,然后我再对一些细节让它做了微调,几轮下来结果就还不错了(看图7-图8)--- 我的提示词1开始 ----帮我站在用户的角度重新思考 designs/baocut/BaoCut.html ,尤其是新用户如何更容易上手去优化原型结构,不要局限于当前的设计,跳出当前设计更多从用户功能角度思考。把 Agent 提到左侧主入口:左侧有历史会话和最近项目,可以方便的进入agent新开会话(图片重点参考对话框和对话消息历史)Agent 底层是 Claude cli、Codex cli 等现成的 Harness 和订阅要结合当前 baocut 的功能特点打通翻译字幕等位置的入口从右侧tab去掉agent tab原有 LLM API 翻译等功能使用 API 调用 LLM 的保留,但是形式可以重新思考请基于这个思路升级改造原型--- 我的提示词1结束 ------- 我的提示词2开始 ----帮我站在新用户的角度重新思考 @designs/baocut/BaoCut.html 设计,看怎么体验更友好。重新梳理 Project 和 Agent Session 之间的关系,让它们能更无缝的切换思考:一个agent session会话是不是应该只和一个projects绑定,但是输入框应该能通过 @ 方便的引入其他 Project 作为上下文参考如果一个会话只能绑定一个项目,是不是可以把最近会话和最近项目放一起,变成二级的,一级是项目,展开是 agent 会话?重新思考 Project 中 AI Tools 功能,让它更好的和 Agent 打通,同时又能使用 Cloud Model API重新思考 Home,是不是应该改成 Agent 入口?重…
查看原文链接
31
#WorkBuddy平台上线# 腾讯这次动作的核心在于解决一个真问…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 08:26:47 +0800 2026 | 分类: 工具产品
时效性:96.4 | 来源可信度:42.0 | 新意:67.0 | 传播性:27.2 | 信息密度:96.0 | 知识性:87.0 | 原创信号:86.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 3 / 点赞 2
原文
#WorkBuddy平台上线# 腾讯这次动作的核心在于解决一个真问题:AI能力如何从实验室走进具体场景。过去一年,大模型卷参数、卷推理,但用户打开率始终上不去,症结在于缺乏承载能力的“容器”。WorkBuddy做的是搭台子——让硬件商、应用开发者、场景需求方在同一套规则下对接,把碎片化的AI能力变成可调用的标准模块。接入30多个硬件品牌和20多个行业应用,意味着它在尝试建立连接规范,而非单纯提供工具。这种平台思路能否成立,取决于三方能否形成正向循环:开发者愿意来,用户用得上,硬件卖得动。如果跑通,它改变的不是技术本身,而是AI产品从生产到交付的整条链路。
查看原文链接
32
就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,…
作者: 新智元 | 时间: Wed Sep 02 19:42:00 +0800 2026 | 分类: 工具产品
时效性:75.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 2 / 点赞 11
原文
就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。事情是这样的。9月1日,Hugging Face上线了两个开源端侧模型:星火X2.5-4B和1.7B。本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两圈的对手,狠狠地秀了一把肌肉。比如考验多轮工具调用的τ³-bench,拿了30.4分。这测的是极限定力,几十步操作连轴转,中间只要错一步,整个任务直接拉胯。测试MCP协议的MCP-Atlas,拿下54.6分。把它丢进真实的API环境里,它给接口填的参数严丝合缝,一点报错的空子都不钻。自主上网搜信息的BrowseComp,跑到40.9分。哪怕网页里一堆弹窗和垃圾代码,它照样能像活人一样,把有效数据生抠出来。至于专考「听人话」的IFBench,更是飙到了75.0分。面对那种字数超长、格式层层叠加的变态指令,它硬是做到了一丝不差。在考察智能体(Agent)、工具调用和真实任务完成率这几项硬指标上,更是实现了「越级打怪」。1.7B版本也不含糊。在考察MCP工具使用的MCP-Atlas里,它拿了23.4分,同尺寸这一档里最高。光看数字没意思,我们第一时间把它下下来跑了跑。装进本地环境后,直接下指令:写一个霓虹烟花的HTML页面。代码出得极其利落,一口气吐完,中间不带卡壳的。跑出来的效果确实惊艳。鼠标点哪儿哪儿炸,一簇七十多颗粒子四散开来,同一朵烟花颜色高度统一,粉的、青的、橘的随机切换——烟花的物理动态和氛围感,一下就出来了。值得一提的是,这两款模型从头到尾都基于全国产算力平台完成训练,部署端更是打通了英伟达、华为、海光及后摩等主流硬件平台。做这件事的,是科大讯飞全资子公司「词元星火」。
查看原文链接
33
【专业门槛决定大模型输出的上限】大众普遍认为大模型抹平了技术鸿沟,…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 09:37:58 +0800 2026 | 分类: 模型
时效性:98.3 | 来源可信度:42.0 | 新意:63.0 | 传播性:27.2 | 信息密度:93.0 | 知识性:92.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、大模型、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 2 / 点赞 6
原文
【专业门槛决定大模型输出的上限】大众普遍认为大模型抹平了技术鸿沟,让所有人都能通过简单指令获得博士级的数学推导或及格的代码。但数学家陶哲轩与ChatGPT的对话揭示了残酷的真相:即便使用同样的模型,专家与门外汉得到的产出存在质变。陶哲轩的指令极度精简,他从不被动接受模型的逻辑诱导,而是不断通过专业直觉修正方向,将模型强行拽入“专家对话模式”而非“科普模式”。这种差异并非源于所谓的提示词技巧,而是源于对领域知识的深度掌控。当模型试图给出平庸或错误的路径时,只有专家能敏锐识别并给出精准的推力。大模型本质上在奖赏专业主义。虽然它能让新手完成从0到1的跨越,但在处理复杂系统设计或前沿科学探索时,人类的专业认知才是那个决定性的瓶颈。信息早已存在于模型之中,但如何将其精准萃取出来,取决于用户是否知道正确答案的轮廓。在通用技能泛滥的时代,对具体业务逻辑的深刻理解反而成了稀缺资产。如果你无法判断模型何时在胡言乱语,你就永远无法榨取它的极限价值。最终拉开差距的不再是工具的使用频率,而是你引导模型冲破平庸输出的专业深度。
查看原文链接
34
【保险理赔员正成为全美最仇视AI的群体】Glassdoor数据显示…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 09:19:23 +0800 2026 | 分类: 模型
时效性:97.8 | 来源可信度:42.0 | 新意:63.0 | 传播性:27.2 | 信息密度:93.0 | 知识性:92.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、claude、openai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 1
原文
【保险理赔员正成为全美最仇视AI的群体】Glassdoor数据显示,保险理赔员对AI的负面评价高达98%,这一职业正经历前所未有的动荡:一年内从业人数锐减21%,初级岗位招聘直接减半。表面看是技术替代人力,实则是高管们在酒会上听信了OpenAI或SaaS厂商的效率神话,强行把尚不成熟的工具塞进工作流。理赔员现在更像是给AI擦屁股的清洁工,他们必须处理AI因幻觉产生的错误分类和虚假摘要,同时还要在缩编压力下安抚那些因算法出错而愤怒的客户。更有意思的转折在于,这场博弈正演变成一场AI对抗AI的军备竞赛。当保险公司试图用自动化系统增加理赔门槛、缩减开支时,投保人也开始利用Claude等工具整理长达百页的证据包,精准引用法律条款进行回击。这不再是单纯的技术进步,而是一场责任转嫁的数字游戏。公司买到的是节省成本的幻觉,员工承担的是系统性混乱的代价,而对普通人来说,在日益僵化的官僚体系缝隙里,AI或许正成为个体对抗大机构唯一的数字外挂。
查看原文链接
35
#谷歌正式发布Gemini3.8#北美大豆包这次发的3.8flas…
作者: 蚁工厂 | 时间: Thu Sep 03 00:36:21 +0800 2026 | 分类: 模型
时效性:83.3 | 来源可信度:42.0 | 新意:67.0 | 传播性:42.9 | 信息密度:92.0 | 知识性:87.4 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 8 / 评论 5 / 点赞 16
原文
#谷歌正式发布Gemini3.8#北美大豆包这次发的3.8flash, 跑分看着还行这次主要也是强化软件工程与智能体工作流支持可调节的努力等级来权衡质量、成本与延迟。模型输入上下文窗口最高 1M token,输出 64K token,知识截止到 2026 年 3 月。目前已通过 Gemini 应用、AI Studio 和 Gemini API 等渠道分发;安全性能与 3.7 Flash 相当,非英语安全表现略有回落。等明天体验下看能不能翻身😉
查看原文链接
36
Anthropic 刚开源了一个 /claude-api 的 sk…
作者: 宝玉xp | 时间: Thu Sep 03 09:54:18 +0800 2026 | 分类: 新闻
时效性:98.8 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、提示词、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 7
原文
Anthropic 刚开源了一个 /claude-api 的 skill,内置到了 Claude Code。这个 Skill 的使用场景是帮你优化 Claude API 调用的,针对 Agent 开发或者基于 Claude API 开发,如果你只是 Claude Code 用户,那么不需要管,或者你不是用的 Claude 模型,那效果估计要差一点,但也会有效果。使用方法很简单,在 Claude Code 里输入 /claude-api 加子命令,就能触发对应的诊断或迁移流程。它的代码在 GitHub 上公开:github.com/anthropics/skills/blob/main/skills/claude-api/SKILL.md这个 skill 本身不是一个独立工具,而是一组结构化的参考文档和工作流指令。当 Claude Code 检测到你的项目里 import 了 Anthropic SDK,或者你主动输入 /claude-api,它就会把对应语言(Python、TypeScript、Java、Go、Ruby、C#、PHP 或 cURL)的 API 文档加载到上下文里,让 Claude 在帮你写代码时有准确的 API 知识可用。支持 8 种语言,覆盖两个开发面:Messages API(常规的请求、流式输出、工具调用、批量处理、提示词缓存等)和 Managed Agents(Anthropic 托管的有状态 Agent,带沙箱环境)。三个主要的子命令/claude-api cost-optimize分析你项目的实际 API 使用情况,按优先级排列省钱建议。它不是给你一份通用清单,而是看你具体的用量模式,逐项提出修改方案,你可以逐条批准或跳过。检查的项目包括缓存配置、Token 冗余、批量处理机会、effort 级别和模型选择。/claude-api prompt-audit扫描项目里的提示词和 skill 文件,找出针对当前模型来说已经过时或有问题的写法。比如过度验证(让模型反复确认自己的输出)、多余的强调语句、过时的 few-shot 示例、自相矛盾的规则。产出两样东西:一份审计报告(标出具体文件、行号和问题模式),以及一个修改建议的 diff。/claude-api migrate帮你把现有的 Claude API 代码迁移到更新的模型。它会先确认范围(哪些文件需要改),再逐个文件分类,然后按目标模型的 breaking changes 列表逐项处理。比如从 Fable 5 迁移到 Fable 5.1,或从 Opus 4.6 升级到 4.8,涉及的参数变化、废弃字段、新的默认行为,都会在这个流程里覆盖到。这些命令在 Fable 5.1 发布的背景下尤其有用。Fable 5.1 的提示词缓存价格降了 75%,但你得先确认自己的缓存配置没有问题才…
查看原文链接
37
我们正在开源 Lily,这是一个为 Apple Silicon 设…
作者: 斌叔OKmath | 时间: Thu Sep 03 08:42:23 +0800 2026 | 分类: 新闻
时效性:96.8 | 来源可信度:42.0 | 新意:63.0 | 传播性:27.2 | 信息密度:89.0 | 知识性:94.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 推理、qwen、inference 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 7
原文
我们正在开源 Lily,这是一个为 Apple Silicon 设计的轻量级本地推理引擎,直接针对 Qwen MoE 架构进行了优化,并基于自定义 Metal 内核和一个紧凑的 Rust 运行时实现,该运行时管理会话状态和生成循环。我们针对 Qwen 的确切架构和维度仔细优化了该引擎:预填充/解码的矩阵/向量内核、专家、注意力以及循环路径之间最小化的数据移动,以及针对实时工作负载调优的图块和布局。通过这些优化,我们在 Qwen3.6-35B-A3B Q4 上实现了比 MLX-LM 快 1.23 倍的预填充和快 1.35 倍的解码!欲了解更多详情,请查看我们的博客和代码:代码:网页链接…博客:引用:Today we’re open-sourcing Lily, the local inference engine we built for hybrid compute in Perplexity Computer.Lily is specialized for Qwen3.6-35B-A3B on Apple silicon, built so on-device compute doesn’t bottleneck Computer tasks.Read more: 网页链接…网页链接
查看原文链接
38
电子书 :强化学习导论 地址:walkinglabs.github…
作者: 蚁工厂 | 时间: Wed Sep 02 19:45:31 +0800 2026 | 分类: 模型
时效性:75.2 | 来源可信度:42.0 | 新意:63.0 | 传播性:59.9 | 信息密度:93.0 | 知识性:86.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、大模型、多模态 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 45 / 评论 0 / 点赞 31
原文
电子书 :强化学习导论 地址:walkinglabs.github.io/hands-on-modern-rl/之前发过,书最近又更新了不少,就再发一次~全书共七部分、二十六章。前三部分建立强化学习的统一语言和算法基础;第四部分把这些工具带入大语言模型后训练;第五、六部分研究动作空间扩展到工具和多模态世界后出现的新问题;第七部分讨论如何发现失败、建立可靠评测并继续推进研究。附录提供算法实现、数学基础与工程查阅资料。“强化学习研究一个朴素而困难的问题:一个系统采取行动、观察结果,再根据结果改进下一次行动。当奖励会延迟出现、环境信息并不完整、一次更新还会改变后续采样分布时,监督学习中熟悉的“输入—标签”框架便不再够用。我们需要描述交互过程,估计长期回报,并在有限数据下稳定地改进策略。Hands-On Modern RL 围绕这条问题主线展开。全书从 CartPole 和多臂老虎机开始,让状态、动作、奖励与策略先成为可以观察的对象;随后用马尔可夫决策过程、价值函数和贝尔曼方程建立统一语言,再依次进入 DQN、策略梯度、Actor-Critic、PPO、连续控制和离线强化学习。掌握这些工具后,大模型后训练中的 RLHF、DPO、GRPO 与 RLVR 就不再是一组孤立名词,而是同一套序贯决策思想在语言模型上的延伸。后半部分把环境扩展到工具、浏览器、代码仓库、视觉与音频世界。动作可能是一段文字、一次函数调用或一组界面操作,奖励也可能来自人类偏好、规则验证器或过程奖励模型。问题的形式变得更丰富,但贯穿全书的三个问题保持一致:如何表示决策过程,如何把结果归因给此前的动作,如何确认策略真的变得更好。”
查看原文链接
39
谷歌杀疯了
作者: CSDN | 时间: Thu Sep 03 09:29:16 +0800 2026 | 分类: 模型
时效性:98.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
谷歌杀疯了!Gemini 3.8 Flash 昨夜正式发布,六周内连更三款 Flash,43 天三代迭代,Jeff Dean 都走了谷歌还在疯狂卷模型,这节奏直接把 AI 圈整麻了🔥 先看硬数据,确实猛: - LMArena Agent 榜空降第 14,微弱优势险胜 DeepSeek-V4-Pro - DeepSWE v1.1 拿 73.7%,距 Opus 5 的 74.0% 仅差 0.3 个百分点 - Terminal-Bench 2.1 以 89.4% 反超 Opus 5 的 89.1% - HLE-Verified 人类终极考试 54.9%,和旗舰差距肉眼可见缩小 - 输出速度 305 token/s 断层第一,几乎是第二名 Meta 的两倍 - 定价一分没涨:输入 $0.75 / 百万 Token,输出 $3.75 / 百万 Token 对一款走量定位的 Flash 来说,这表现确实超常发挥了。 但全网都在调侃谷歌这波是 "邪修"—— OpenAI 和 Anthropic 都在努力让模型用更少步骤完成任务,谷歌反其道而行:完成任务需要的步骤越来越多,主打靠 Loop 大力出奇迹。面对复杂任务,3.8 Flash 会多走几步推理、反复迭代调用工具,高 effort 档位下比前辈烧更多 Token。 代价就是:虽然 Token 单价没涨,但单任务成本 0.58 美元,比 3.7 Flash 反而涨了约 40%,每个任务平均输出 4.8 万 Token。所谓性价比,好像也没那么香了。 更尴尬的是刷分争议。在 8 月底刚出的 Terminal-Bench 4.0 上,3.8 Flash 直接拉胯到 19.1%,而 Opus 5 是 51.8%—— 老基准猛如虎,新基准原形毕露,网友直言 "纯纯刷分刷出来的"。 真正的隐藏杀器是 3.8 Flash Cyber—— 谷歌史上最强网络安全模型,专攻自主挖漏洞、自动生成补丁。CyberGym 漏洞发现测试 86.2% 屠榜,覆盖 20 种编程语言的内部代码库挖洞成功率超 70%,CWE-Bench 修洞 pass@1 达 47.2%,几乎打平领跑的前沿模型(47.8%),成本却低一大截。 实战更炸裂:Chrome 安全团队拿它修洞,正确补丁数量是最强商业模型的 2.6 倍;Wiz 用它跑渗透测试,召回率提升 7.5-9.7 个百分点,花费只有其他模型的 1/2.3 到 1/5.2;最夸张的是 Google Cloud 漏洞研究团队,用它不到 2 小时就挖出一个以往需要研究数月的关键基础漏洞。 可惜能力太强,不公开发布,仅通过 Fairwind 计划向受信防御者开放 —— 又是一个只守不攻的模型。 DeepMind 姚顺宇的点评很到位:对模型来说只是一小步,对 RSI(递归自我改进)来说是一次巨大飞跃。六周三款…
查看原文链接
40
Awesome-ML-SYS-Tutorial地址:github.…
作者: 蚁工厂 | 时间: Wed Sep 02 19:49:45 +0800 2026 | 分类: 新闻
时效性:75.3 | 来源可信度:42.0 | 新意:63.0 | 传播性:50.7 | 信息密度:93.0 | 知识性:98.0 | 原创信号:90.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 18 / 评论 2 / 点赞 23
原文
Awesome-ML-SYS-Tutorial地址:github.com/zhaochenyang20/Awesome-ML-SYS-Tutorial关于 ML SYS / AI Infra 的系列博客和资源收集。内容包括:Omni Model 推理札记RLHF System 开发笔记SGLang 学习笔记ML System 基本功等等~ 下面为作者的话-----经常看到有朋友讨论 ML SYS 或者 AI Infra 值不值得入行,以及如何开始。每个人的选择各有不同,对我而言,我只是想追求算法上的真理:----非常多的 paper 得出的 RL 结论,都是建立在开源社区可能漏洞极其多的 RL infra 上。我自己参加 RL infra 开发一年多,见到众多社区的大佬都殚精竭虑辛勤付出,但是事实上无论是开源还是各大公司内部,RL infra 仍旧有着非常多问题,基于这些有问题的基建得到的上层结论是否正确,这事非常值得反馈的。我在今年 ICLR review 的时候,就经常问我分到的 paper,“如果你们采用的框架本身实现就有问题,你们的结论还能成立么?”尽管我从没为了这个理由扣他人的分,但是没有一个人能给出解决我心头疑惑的答案。 因此,我认识的一些大佬会乐于参加 infra 的开发,甚至绝大多数时间都在做基建上,为了严格确定自己接下来要做的算法具有正确的基础。我非常佩服他们,我也认同这样的严谨性,他们是我的榜样。我们 SGLang RL 社区也是如此,这么多人力,这么多时间,我们都希望提供尽可能正确且简洁的 RL 基础,无论是公司训练模型,还是研究者展开新的算法,希望能真正服务到社区每个人。感谢大家的认可,也期待感兴趣的朋友联系我,加入我们!兜兜转转一年,这就是目前让我坚持继续做 Infra 的决心,为了做出正确的基础建设,为社区得到正确的结论做出自己的贡献。言归正传,这一系列博客是我从 2024 年 8 月,在科研的契机下使用了 SGLang 后,逐渐开始学习 ML SYS 的笔记。大体上是我本人所写,内容主要是 RL infra,在线/离线推理系统,以及一些 AI Infra 的基本功。一年来,从最开始两三篇文章,三五十个 Github Star,到现在 Star 超过 4.5K,而我也成了技术圈小网红,真是承蒙厚爱,不甚荣幸。"
查看原文链接
41
前苹果 AR/VR & AI 的 UI/UX 负责人 Anshu …
作者: i陆三金 | 时间: Wed Sep 02 12:19:52 +0800 2026 | 分类: 用法技巧
时效性:62.8 | 来源可信度:42.0 | 新意:69.0 | 传播性:53.6 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它对实际使用方法有直接参考价值;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 24 / 评论 1 / 点赞 25
原文
前苹果 AR/VR & AI 的 UI/UX 负责人 Anshu Chimala 在 Lenny 的订阅频道写了篇文章,分享如何将你的 AI 打造成世界级设计师附大量提示词案例8个 tips:1. 使用种子字符串注入多样性2. 让提示词更具开创性3. 与子 agents 建立正向反馈循环4. 使用图像生成来丰富设计5. 使用视频生成实现更复杂的动态效果6. 剔除不增加价值的元素7. 去除AI痕迹8. 手动重写文案---1. 使用种子字符串注入多样性核心思路是引导模型跳出训练数据形成的默认路径,为设计寻找全新的灵感源泉。Sakana AI 发布的"思维种子字符串"技术正是为此而生:我们让 AI 生成随机字符串并将其作为设计灵感,这样模型每次都能做出真正不同的决策。提示案例:<请为我的效率应用设计一个落地页面。请遵循以下步骤:使用脚本生成一串随机的字母数字长字符串。根据这串字符定义设计方向(配色方案、版式、字体等)。不止于表面,去发现隐藏的规律、特殊数字或其他能激发灵感的元素。运用你的判断力将这个方向具象化,并精心打磨设计效果。请勿在设计中展示这串字符。它仅供你获取灵感之用。>2. 让提示词更具开创性另一种推动模型发挥潜力的方法是让提示词更具体、更天马行空。这为模型提供了清晰的决策框架,而非任其即兴发挥。寻找独特创意的最佳途径是融入你自身的审美取向:首先想象灵感来源——可以是电子游戏、室内设计潮流或艺术装置——然后描述你希望这种灵感如何影响 AI 的输出。当然,难点在于构思新颖的提示指令。AI 在这方面也能提供帮助,但若直接索要创意,得到的会是千篇一律的平庸方案。以下是与 AI 协同生成独特提示词的系统方法:- 让 AI 列出一堆想法,故意省略细节。目的仅仅是激发你的想象力。- 将你喜欢的视觉效果具象化,并记录自己对不同设计方向的反应,再要求 AI 进行优化。- 迭代至满意后,要求 AI 生成构建提示词3. 与子 agents 建立正向反馈循环不要让编码 agent 自行判断设计是否达标,而是让它询问另一个agent——"设计评审员"。评审员的任务是查看当前设计的截图并提供反馈。它不关心当前设计的实现方式或投入的工作量,只判断其是否真正达到质量门槛。这种方法还有一项额外优势:我们可以使用庞大而昂贵的评审模型,同时不会超出预算,因为它仅用于最终决策。一个轻量快速的模型承担基础工作,而强大的评审模型则负责把控品质标准。用 Claude Fable 5 作为评审模型,对之前的设计方案进行实践测试,提示词:<希望你能优化这个设计方案。为明确改进重点,请调用小模型智能体作为设计评审顾问。请遵循以下流程进行每轮迭代:截取当前设计方案的屏幕截图在全新语境中唤起批评家机制,仅提供截图——不包含代码、实现细节或先前的迭代/批判内容。请它评估设计所追求的美学风格,想象顶级设计工作…
查看原文链接
42
#谷歌正式发布Gemini3.8#谷歌今夜发布Gemini 3.8…
作者: 新智元 | 时间: Thu Sep 03 08:51:23 +0800 2026 | 分类: 模型
时效性:97.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
#谷歌正式发布Gemini3.8#谷歌今夜发布Gemini 3.8 Flash及网络安全专攻版3.8 Flash Cyber,这是六周内谷歌连发的第三个Flash版本,单任务成本仅0.58美元,输入价0.75美元/百万Tokens。#科技先锋官# 在Artificial Analysis高推理模式下,3.8 Flash智力指数飙到59分,逼近GPT-5.6 Sol和Grok 4.6,部分维度超越Claude Opus 5;生成速度305 tokens/s,是次快模型的两倍。长周期软件工程基准DeepSWE v1.1上拿下73.7%,谷歌内部代码工具测试中,工程师已更倾向用它而非Anthropic的Opus。不过也有质疑:Meta的Muse Spark 1.3智力指数已达62分,与Claude Fable 5持平;TBench 2.1与TBench 4的巨大分差,也暴露3.8 Flash可能存在"刷榜"成分。谷歌回应称,提升源于"工作得更努力"——多轮推理和工具调用自我验证,总成本依然远低于竞品。真正杀器是Cyber版:CyberGym漏洞发现基准跑出86.2%屠榜成绩,20种语言代码库测试中发现漏洞成功率超70%;Chrome安全团队实测其生成正确修复补丁数量是此前最佳商业模型的2.6倍,谷歌云团队更用它2小时内挖出以往需数月才能发现的关键漏洞。因破坏力过大,该模型仅通过Fairwind计划向受信任机构开放。三巨头中Claude死磕知识可靠性,GPT押注深度推理顿悟,谷歌则押注"无尽循环的超高速打工",用低成本暴力迭代替代单次深度思考。
查看原文链接
43
【Claude总结】 AI开发者日报 (2026-09-02)1.…
作者: 时蝇喜箭 | 时间: Thu Sep 03 08:40:23 +0800 2026 | 分类: 新闻
时效性:96.7 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
【Claude总结】 AI开发者日报 (2026-09-02)1. 【Gemini 3.8 Flash 与 Flash Cyber 发布】(来源: HN) Google 推出新一代 Flash 系列模型,新增专攻网络安全任务的 Cyber 变体。轻量模型在速度和成本上持续压低,安全垂直版本显示厂商开始按场景切分模型线。 blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/2. 【Mistral:能否拒绝数据被用于训练】(来源: HN) Mistral 官方帮助文档说明用户如何选择退出输入输出数据用于模型训练。该页在 HN 冲上高分,反映开发者对 API 数据留存和隐私条款的高度关注。 help.mistral.ai/en/articles/455207-can-i-opt-out-of-my-input-or-output-data-being-used-for-training3. 【Meta 发布 Muse Spark 1.3】(来源: HN) Meta 开发者平台上线 Muse Spark 1.3 模型,第三方分析站同步给出性能与价格评测。定价和推理速度成为讨论焦点,显示模型竞争已进入精细的性价比对比阶段。 developer.meta.com/ai/models/muse-spark/4. 【三个站点造了 21 万个"最佳软件"页面喂给 AI】(来源: HN) 一份调查报告揭示三家公司批量生成 215,128 个"最佳软件"排行页,Perplexity 等 AI 搜索直接引用这些内容。这暴露了生成式搜索引用链被 SEO 农场污染的系统性风险。 trellner.com/reports/manufactured-sources-behind-ai-recommendations/5. 【Fable 5.1 世界建模】(来源: HN) PhiloLabs 开源 Fable 5.1 的世界模型相关代码,探索让模型维持一致的虚拟世界状态。世界模型被视为通向长程规划和具身智能的关键路径之一。 github.com/PhiloLabs/fable51-worlds6. 【WebLLM:浏览器内高性能 LLM 推理引擎】(来源: HN) mlc-ai 的 WebLLM 让 LLM 完全在浏览器本地运行,无需服务器。它把隐私敏感场景和离线推理的门槛降到只需一个网页,对前端 AI 应用意义重大。 github.com/mlc-ai/web-llm7. 【METR 关于 OpenAI/Hugging Face 黑客事件的报告】(来源: HN) METR 发布对 OpenAI 与 Hugging Face 相关入侵事件的调查报告,梳理核…
查看原文链接
44
Manus 关于“隐喻率”的模型评测指标,by 胡迪Hoodie-…
作者: i陆三金 | 时间: Wed Sep 02 17:47:09 +0800 2026 | 分类: 模型
时效性:71.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 1 / 点赞 4
原文
Manus 关于“隐喻率”的模型评测指标,by 胡迪Hoodie---如何 eval agent 产出的调研报告是否易读?分享我们 team 实践中用的一个简洁指标——「隐喻率」:隐喻是常见的语言学现象,简单理解就是在句子中“悄悄”使用比喻。来感受一个隐喻率很高的句子:“全栈 AI 帝国率领评估军团与标注大军,向全球 Tier 1 俱乐部发起冲锋,踏上下一阶段的马拉松。”句子里的“率领”“发起冲锋”“踏上”都是明显的动作隐喻;“AI 帝国”“评估军团”“标注大军”“全球 Tier 1 俱乐部”“马拉松”共同构成了竞争与征战的意象。但这句话其实完全可以写成: “全栈 AI 体系由评估团队和大规模标注团队组成,目标是冲击第一梯队,并参与下一阶段的长期竞争。”隐喻让这句话变得更加抽象和复杂,你的大脑需要处理一下才能让句子返璞归真,这就降低了报告的易读性。其实,隐喻的存在本身是希望通过把陌生、抽象的概念类比成更熟悉的概念,从而帮助理解。但 LLM 高密度、不适宜的隐喻使用,很可能把抽象的概念表达得……更抽象。而且,从数学上讲,隐喻更本质的影响是:它作为一个把 x 词映射成 y 词的“语言函数”(y=f(x)),势必会带来信息的损失(y 的信息量一定小于等于 x)。综上,我们构建了隐喻率指标(图1&2):每一百句话中出现多少次隐喻表达。通过隐喻率指标,我们可以从一个视角来反映模型的写作特征——更高的隐喻率往往意味着这篇报告更难读,且会带来信息的损失。我们衡量了来自 9 个主流模型、各自 36 篇不同主题的中英文研究报告的隐喻率。发现 GPT 5.6 系列模型在隐喻使用上更克制;claude-fable-5 毫无疑问地拿下了最高隐喻率的桂冠(图3)…如果你曾阅读过 fable 的作品,就会发现 fable 真的非常喜欢用“臂”“腿”等人体隐喻来指代“组别”的概念 (图4)。而 opus-5 在隐喻使用上反而比 fable-5 更加克制。当然,隐喻率只是衡量报告易读性众多 signal 中的一个:隐喻率低也并不绝对意味着文章更易读。但如果构建出许多像隐喻率这样简洁、可操作的 signal,我们就一定能更好地把握 LLM 的本来特性。
查看原文链接
45
李飞飞参与创办的 World Labs 推出了全新一代世界模型 A…
作者: i陆三金 | 时间: Wed Sep 02 09:33:36 +0800 2026 | 分类: 模型
时效性:58.2 | 来源可信度:42.0 | 新意:68.0 | 传播性:66.9 | 信息密度:93.0 | 知识性:98.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;同时涉及 模型、ai、多模态 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 89 / 评论 11 / 点赞 144
原文
李飞飞参与创办的 World Labs 推出了全新一代世界模型 AtlasAtlas 是多模态世界模型,能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。- 摄像机可控生成:Atlas 可基于一张或多张图像生成图像与视频,提供像素级精准的摄像机控制,输出最高 1440p 分辨率、长达 1 分钟的视频。- 空间重建:Atlas 可从一张至数十张输入图像中重建真实世界场景。它既能生成新视角下的图像帧,也能输出显式的三维结果,其性能超越专精于三维重建的最新模型。- 时空模拟:Atlas 从输入视频中建模空间和时间,重新构架视频以产生戏剧性视觉效果,并实现机器人技术的真实到模拟工作流程。- 图像生成:Atlas 从文本生成图像和 360 度全景图;它可以遵循复杂提示、渲染文本,并生成多种视觉风格。链接:www.worldlabs.ai/blog/atlas i陆三金的微博视频
查看原文链接
46
两个人写了一页规格书,其余部分由AI在2周内设计了芯片
作者: 斌叔OKmath | 时间: Thu Sep 03 09:16:07 +0800 2026 | 分类: 模型
时效性:97.7 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 1
原文
两个人写了一页规格书,其余部分由AI在2周内设计了芯片。这是帕洛阿尔托初创公司Architect Labs发布的Redwood相关内容,从性能模型到RTL、验证、固件、驱动、内核,规格书以下的步骤都没有人工参与。首次将RTL加载到FPGA时,bug数量为0,到了第3周,就在上面运行了Qwen3推理。数字是这样的。按三星8nm标准换算,比Nvidia Jetson Orin Nano的处理量高1.75倍,功耗节省1.9倍,综合算下来,瓦特当性能是3.4倍。这是与边缘芯片而非数据中心GPU的比较,而且还是FPGA上的结果而非实际硅片,需要注意这一点。不过,这家公司自己起的名字才是重点。如果Nvidia作为无晶圆厂公司走了30年,这家公司则要做“无设计者”的半导体公司,几乎没有设计师。这是XPRIZE创始人Peter Diamandis播客里提到的内容,出演者是投资者的因素需要考虑,但除去那个,剩下的一个事实就是:在半导体设计人力是最昂贵资源的行业中,首次出现了用2周软件取代这一资源的情况。[视频]网页链接
查看原文链接
47
【AIGC日报 · 2026-09-03】今日简讯:1、OpenA…
作者: 德里克文 | 时间: Thu Sep 03 08:33:02 +0800 2026 | 分类: 工具产品
时效性:96.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 5
原文
【AIGC日报 · 2026-09-03】今日简讯:1、OpenAI发布Astra模型,首次达到"关键"网络安全等级2、谷歌正式发布Gemini 3.8 Flash及Cyber安全变体3、Meta发布Muse Spark 1.3最强AI模型4、中国开放权重模型加速融入全球AI产业链5、全球首款AI智能体手机努比亚NaviX Ultra入网,9月开售6、博通Q3营收295.91亿美元,AI业务指引上调至580亿美元7、LLM Token支出指数跌至历史新低97美分以下为详细内容:1、OpenAI发布Astra模型,首次达到"关键"网络安全等级来源:财联社、每经网日期:2026年9月3日正文内容:OpenAI宣布其新AI模型Astra已在其内部Preparedness Framework中首次达到"关键"网络安全能力等级。Astra在ExploitBench基准测试中实现了已知漏洞的满分,在内部测试中发现了两个真实零日漏洞。OpenAI表示已将相关漏洞披露给软件维护方。Astra的部分功能将推迟数周发布以加强安全防护,其高级网络安全功能最初仅限经过审查的用户使用。同时,Astra采用"recurrent depth"技术引发安全争议,多位安全研究人员质疑其推理过程的可监控性。OpenAI首席科学家Jakub Pachocki回应称相关担忧基于"混淆的报道"。原文链接:网页链接2、谷歌正式发布Gemini 3.8 Flash及Cyber安全变体来源:财联社日期:2026年9月3日正文内容:谷歌于9月2日正式发布Gemini 3.8 Flash,这是六周内推出的第三个Flash版本。该模型在DeepSWE v1.1长视野软件工程测试中得分73.7%,在HLE-Verified测试中取得54.9%。同时推出Gemini 3.8 Flash Cyber安全变体,通过Fairwind计划向可信防御者开放。谷歌还发布Agentic Video Understanding功能,支持动态搜索和扫描视频内容,Token消耗降低多达88%,成本降低66%,准确率提升7%。此外,谷歌推出Google Pics图像创作与编辑工具,面向Google AI Pro和Ultra订阅用户及Workspace商业客户。原文链接:网页链接3、Meta发布Muse Spark 1.3最强AI模型来源:环球市场播报日期:2026年9月3日正文内容:Meta Platforms Inc.发布其迄今最强大的AI模型Muse Spark 1.3。Meta首席AI官称,新模型性能距离顶尖竞争对手又近了一步。开发者从9月3日起可访问并付费使用Muse Spark 1.3。Meta还将很快把这一更新推向Instagram、Facebook等社交媒体平台以及Meta AI的用户。原文链接:网页链接4、中国开放权重…
查看原文链接
48
【Meta Muse Spark 1.3:当隐私成为大模型的显性折…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 08:30:55 +0800 2026 | 分类: 模型
时效性:96.5 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 3
原文
【Meta Muse Spark 1.3:当隐私成为大模型的显性折扣】Meta正式发布Muse Spark 1.3,重点提升了智能体(Agentic)和代码处理能力,并引入了类似o1的高阶推理模式。该版本最核心的商业变动是推出了“贡献者”(Contributor)定价方案:如果用户允许Meta使用其数据进行模型训练,Token价格将直降20倍,降至每百万Token 0.1至0.2美元。此外,该模型实现了全模态覆盖,并确认未来将发布开放权重版本。这次发布标志着大模型商业模式进入透明化转折点。Meta直接把“数据换算力”的潜规则摆到了台面上,让隐私变成了可量化的价格标签。对于开发者而言,Muse Spark 1.3的意义不在于它是否在所有指标上超越了Claude或GPT,而在于它提供了一个极具性价比的工程底座。在智能体任务中,它更倾向于精确执行指令而非过度“热心”地提供建议,这种纯粹的工具属性配合极低的成本,非常适合大规模的自动化流水线。然而,评论区激烈的伦理争论也提醒我们,技术迭代无法掩盖企业的社会信用争议。当行业进入Sigmoid曲线的平台期,模型层面的微小差距正在被激进的商业策略和生态开放度所弥补。
查看原文链接
49
刚才我看到根据晚点团队的报道,月之暗面,悄悄向香港交易所递交了上市…
作者: AIGC·非著名程序员 | 时间: Thu Sep 03 07:47:06 +0800 2026 | 分类: 模型
时效性:95.3 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 3 / 点赞 6
原文
刚才我看到根据晚点团队的报道,月之暗面,悄悄向香港交易所递交了上市申请。具体来说,他们本周以"保密"的方式提交了一份叫 A1 的文件。A1 就是企业想在香港上市时要交的正式申请表,一旦递交,就意味着 IPO 流程正式开始跑起来了。对于这个消息,Kimi 官方的回应很官方:"对于市场传闻不予置评,目前暂无可以披露的信息。"言下之意,既没否认,也没确认。更有意思的是,Kimi 同时还在以 500 亿美元的估值推进新一轮融资。500 亿美元是什么概念?折合人民币大概 3600 亿左右。而且据消息人士透露,这轮融资很可能就是 Kimi 上市前的最后一轮了,也就是说,他们在上市前还想再拿一笔钱压压仓。回头看看,Kimi 创始人杨植麟在 2025 年底还说过"短期不急于 IPO",结果不到一年,动作就来了。今年他们的节奏明显快了很多:1 月发布 K2.5,4 月发布 K2.6,7 月又推出新模型,商业化和融资也都在加速推进。为什么要这么急着融资和上市?这就涉及到 AI 模型公司一个特殊的现实:它们的成本结构跟传统软件公司差很多。传统软件公司多卖一份软件,边际成本接近于零。但模型公司每多一个用户调用,就要多消耗一大笔算力资源。模型越强、用的人越多,烧的钱就越快。Kimi 的 K3 发布之后,用户量暴涨,公司一度不得不暂停新用户订阅,把有限的算力优先留给已有的付费用户。所以,融资对他们来说不是锦上添花,是维持运转、继续迭代的必要条件。顺带一提,你可能见过 AI 公司拿"ARR"说事儿。这个词有两种用法:一种是 SaaS 行业常说的"年度经常性收入",强调的是稳定可复购的订阅收入;另一种是 AI 公司更常用的"年化营收运转率",意思是把当前某个月的收入乘以 12,估算出来的全年体量。后者其实更像一个趋势指标,反映的是当下的增速,并不代表实际全年收入已经有那么多。最后说一个行业背景:外界普遍觉得,另一家同样还没上市的中国头部大模型公司 DeepSeek,也可能会在明年上半年跟上来挂牌。中国 AI 大模型公司的上市潮,看起来真的要来了。#科技先锋官##月之暗面被曝将赴港上市#
查看原文链接
50
今天的#60秒芯闻# ,这是我们的一个金牌栏目,网友评论这是半导体…
作者: 张国斌的芯时空 | 时间: Thu Sep 03 10:08:20 +0800 2026 | 分类: 新闻
时效性:99.2 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:96.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 算力、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
今天的#60秒芯闻# ,这是我们的一个金牌栏目,网友评论这是半导体里的”参考消息“!每日精选半导体业界新闻,点击链接可以查看详细内容!#张国斌的芯发布#1 高通公布新一代GPU:矩阵核心强化AI算力、更高频率更低功耗2 苹果秋季发布会前瞻:多款新品曝光含折叠屏 iPhone3 兆易创新加入 Zephyr® 项目,加速全球开源嵌入式生态布局4 深化落实科技创新 加速提升生产力转化5 优必选再获中国专利奖!以运动控制技术专利助力人形机器人稳定运行6 Kioxia将在北上工厂新建Fab3以扩大3D闪存产能7 日产Formula E车队宣布赞恩·马洛尼将搭档奥利弗·罗兰德征战第十三赛季8 聚力国产化供应链|智驱源枢 × 北京人形赛场共赴巅峰9 Uniphore与Tech Mahindra携手合作,为企业打造智能体AI工厂10 SGS为零跑汽车湖州工厂颁发ESD证书 助力国产新能源汽车电子品质升级11 贸泽新一期EIT系列探索量子计算的未来及其促进工程领域转型的潜力12 中科创达携手北京人形机器人创新中心推动机器人规模化落地13 深耕本土生态,共筑“芯”基石:杜邦携Vespel®与MOLYKOTE®解决方案亮相CSEAC 202614 聚力产学研协同|华中科大 × 北京人形赛场斩获多项金牌15 飞鱼科技(01022.HK)持续深化小游戏布局 产品矩阵多点开花16 华北工控MATX-6980:国产化替代+AI性能提升,工业通信网关的理想硬件平台17 【方案精选】中微半导高集成无解FOC破壁机方案 助力中高端产品升级网页链接18 物联芯片主力军 | 紫光展锐V527赋能广和通RU311,共拓5G RedCap物联新空间19 搭载专利技术,兼顾高效率与大电流—圣邦微电子SGM38049直击超小AMOLED供电需求
查看原文链接
51
分享微信团队开源的多模态Embedding模型,可以把文本、图片、…
作者: Simon的白日梦 | 时间: Wed Sep 02 15:11:00 +0800 2026 | 分类: 模型
时效性:67.6 | 来源可信度:42.0 | 新意:67.0 | 传播性:44.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 9 / 评论 0 / 点赞 11
原文
分享微信团队开源的多模态Embedding模型,可以把文本、图片、视频、视觉文档都Embedding到同一个向量空间。WeMM-Embedding,微信视觉团队的通用多模态 Embedding 模型微信视觉团队的通用多模态 embedding。同一套向量覆盖文本、图片、视频、视觉文档和交错输入,2B / 4B / 9B,支持 Matryoshka 截断。向量取最后一层 token 再 L2,暂不支持音频。2B 在 MMEB-v2 平均 77.9(图 79.6 / 视频 70.8 / VisDoc 80.7),9B 平均 80.6。MMEB-v3 全任务 2B 56.0、9B 59.5,音频项记 0。推理建议 transformers==5.2.0,也可走 Sentence Transformers、vLLM、SGLang。2B 截到 256 维,图像和视频成绩仍有全维度的 98.7%。🔗 链接:网页链接(项目)🤗 Hugging Face:网页链接(合集)📄 论文:网页链接(论文)#HOW I AI# #ai生活指南# #效率工具#
查看原文链接
52
推荐一个开源 AI 桌面神器:AQBot
作者: 张岱樾 | 时间: Wed Sep 02 19:02:00 +0800 2026 | 分类: 模型
时效性:74.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:61.0 | 信息密度:86.5 | 知识性:72.3 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、mcp 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 50 / 评论 3 / 点赞 65
原文
推荐一个开源 AI 桌面神器:AQBot。一个软件直接把 OpenAI、Claude、Gemini、DeepSeek、通义千问等模型全装进来,还集成 Agent、MCP、Skills、知识库和 API 网关。聊天记录和配置主要留在本地,API Key 支持 AES-256 加密,Windows、macOS、Linux 全平台支持。GitHub:github.com/AQBot-Desktop/AQBot
查看原文链接
53
看了易论 AI 的这期访谈,收获确实不小
作者: AIGC·非著名程序员 | 时间: Wed Sep 02 18:29:24 +0800 2026 | 分类: 工具产品
时效性:73.1 | 来源可信度:42.0 | 新意:63.0 | 传播性:52.2 | 信息密度:93.0 | 知识性:92.0 | 原创信号:86.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 ai、aigc、agent 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 21 / 评论 7 / 点赞 37
原文
看了易论 AI 的这期访谈,收获确实不小。这次请来的三位嘉宾,李继刚、歸藏、橘子,都是国内 AI 圈里相当有分量的人物。三个人坐在一起聊,碰撞出来的观点颇有意思,有几个点让我印象特别深。第一个是关于 AI 落地的问题。很多人觉得,AI 要落地靠的是好产品,但他们的判断恰好相反,真正让 AI 在实际场景里跑起来的,是服务。因为同样的 AI Agent ,因为使用者能力的差异,其实最终的结果差异也会很大。而且,每个人、每家公司的需求都不一样,能把 AI 真正嵌进具体业务里的,还得靠懂 AI 且又懂业务的人去做服务这一层。第二个观点也很有意思,企业做 AI 转型,其实不需要全员动员,只要搞定 5% 的关键人就够了。这 5% 的人想通了、用起来了,剩下的会慢慢跟上。这个逻辑说起来简单,但背后其实指向的是转型策略,找对人比铺开面更重要。第三点有点反直觉,越"土"的行业,AI 反而越有用武之地。那些数字化程度低、流程还靠人肉操作的行业,AI 进来能解决的问题更多,改善空间也更大。关于 Skill 的两个判断,说得也很直接。把 Skill 卖给个人用户,大概率是个伪生意,因为个人用户付费意愿有限,且需求太散。更关键的是,别人做的 Skill 再好,也很难真正融入你自己的工作流,因为工作流这件事,高度个人化,外人根本摸不透你的习惯和上下文。#How I AI##科技先锋官# 最后一个观点是我觉得最有想象力的,下一张社交网络里,将有一半节点不是人。AI Agent 会以某种身份参与到社交关系里,这张网会长什么样,现在还真说不准。六个判断,每一个单拎出来都值得细细琢磨。 AIGC·非著名程序员的微博视频
查看原文链接
54
【Anthropic上线Claude内容识别器:是合规的“投名状”…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 09:13:20 +0800 2026 | 分类: 模型
时效性:97.7 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、微调、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
【Anthropic上线Claude内容识别器:是合规的“投名状”还是防伪的“护城河”?】Anthropic最近低调上线了一个网页工具,允许用户上传文件检测是否由Claude生成。目前该工具主要识别C2PA标准——这是一种类似数字水印的加密元数据,常见于摄影和绘图软件,用于标记内容的来源。与此同时,针对文本生成的隐形水印API也已进入小范围测试。这件事的本质是AI巨头在监管压力下的集体“防御性合规”。欧盟AI法案和加州法律都明确要求大型模型必须对生成内容进行标注,Anthropic此举更像是为了拿到进入市场的准考证。但从技术逻辑看,这种基于C2PA的检测极易被“洗掉”:只需将图片截图、压缩或放入压缩包重新下载,元数据就会丢失;甚至有用户发现,把文件传回Claude让它“原样展示”一遍,原本干净的文件反而会被打上标记。相比之下,文本水印的争议更大。它通过调整Token预测的概率分布来植入特定统计特征,虽然难以肉眼识别,但这种对概率空间的微调不可避免会干扰表达的自然度,甚至降低输出质量。对于用户而言,这更像是一种单向的“免责声明”:它无法证明内容未经AI修改,也无法防止恶意滥用,却可能在学术或版权争议中成为某种并不绝对可靠的证据。与其说这是为了保护真相,不如说是在AI生成内容泛滥的时代,厂商给监管层递上的一把钝刀。
查看原文链接
55
【Gemini 3.8 Flash:Google的“小钢炮”闪击战…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 08:40:18 +0800 2026 | 分类: 模型
时效性:96.7 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 0
原文
【Gemini 3.8 Flash:Google的“小钢炮”闪击战】Google在六周内连发三个Flash版本,这种“挤爆牙膏”的节奏让行业措手不及。Gemini 3.8 Flash的核心逻辑是典型的以小博大:它不追求在参数规模上硬碰硬,而是通过增加推理步骤和工具调用的“勤奋度”,在DeepSWE等软件工程指标上咬住了比自己贵几十倍的顶级模型。这次同步推出的Cyber版更是把战场引向了网络安全,号称能自主修补Chrome漏洞。这种“快鱼吃慢鱼”的策略正在重塑开发者对模型的认知。现在的共识是,不必死守昂贵的顶级模型,用Gemini Flash这种极速且廉价的工具做原型开发和自动化执行,再配合高级模型做最终审计,是性价比最高的工程方案。虽然Google在产品入口上依然存在AI Studio、Vertex AI、Antigravity等多线作战的混乱感,但其底层TPU算力带来的Token生成速度和多模态原生优势,正让它从早期的追赶者变成一个难以忽视的效率怪兽。对用户来说,与其纠结谁是世界第一,不如带走这个判断:AI的摩尔定律已进入“周更”时代,模型能力正在向廉价的端侧和高频的代理流快速下沉。
查看原文链接
56
CPU 与 GPU 与 TPU 与 NPU 与 LPU,视觉化解析…
作者: 斌叔OKmath | 时间: Thu Sep 03 09:22:20 +0800 2026 | 分类: 模型
时效性:97.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
CPU 与 GPU 与 TPU 与 NPU 与 LPU,视觉化解析:(收藏此文)5 种硬件架构驱动当今的 AI。每一种都在灵活性、并行性和内存访问之间做出根本不同的权衡。> CPU它专为通用计算而构建。少数强大的核心处理复杂逻辑、分支和系统级任务。它拥有深层缓存层次结构和片外主内存 (DRAM)。它非常适合操作系统、数据库和决策密集型代码,但不适合像矩阵乘法这样的重复数学运算。> GPUGPU 不是使用少数强大核心,而是将工作分布到数千个较小的核心上,这些核心在不同数据上执行相同的指令。这就是为什么 GPU 主导 AI 训练的原因。这种并行性直接映射到神经网络所需的数学类型。> TPU它们在专业化上更进一步。核心计算单元是一个乘积累加 (MAC) 单元网格,数据以波浪模式流动。权重从一侧进入,激活从另一侧进入,部分结果传播而无需每次都返回内存。整个执行过程由编译器控制,而不是硬件调度。谷歌专门为神经网络工作负载设计了 TPU。> NPU这是边缘优化的变体。架构围绕神经计算引擎构建,内部填充了 MAC 阵列和片上 SRAM,但与高带宽内存 (HBM) 不同,NPU 使用低功耗系统内存。设计目标是在个位数瓦特功率预算下运行推理,例如智能手机、可穿戴设备和物联网设备。苹果神经引擎和英特尔的 NPU 遵循这种模式。> LPU (语言处理单元)这是由 Groq 推出的最新参与者。架构完全从关键路径中移除了片外内存。所有权重存储都位于片上 SRAM 中。执行过程完全确定性和编译器调度,这意味着零缓存未命中和零运行时调度开销。权衡在于,它每芯片提供的内存有限,这意味着需要数百个芯片链接在一起来服务单个大型模型。但延迟优势是真实的。AI 计算已从通用灵活性 (CPU) 演变为极端专业化 (LPU)。每一步都以某种程度的通用性换取效率。下面的视觉图将所有五种的内部架构并排映射。要深入了解 GPU 具体内容,Akshay 写了一篇详细文章。它从第一性原理构建,解释了为什么内存和计算相互竞争,为什么硬件中存在这种差距,以及是什么让工作负载首先成为内存受限的。在下面阅读。[视频]网页链接
查看原文链接
57
刚看了微博发布的大模型月报,整个 8 月份大模型日均发布1.1个
作者: AIGC·非著名程序员 | 时间: Wed Sep 02 15:25:50 +0800 2026 | 分类: 模型
时效性:68.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 1 / 转发 6 / 评论 7 / 点赞 18
原文
刚看了微博发布的大模型月报,整个 8 月份大模型日均发布1.1个。各大厂商都在拼了命的将 Agent 安排到用户的工作流中去。但是,我盯着榜单看了半天,我感觉最扎眼的其实是角落里那两句热搜:"有AI之后反而更累了",还有"Agent用久了失去独立思考能力"。大家原以为AI变聪明是来帮自己减负的,现实却狠狠上了一课。以前写个方案、攒个报告能磨蹭一天,现在老板知道你手里有大模型,默认你半小时就得甩出三套深度方案。工具的运转速度拉满了,人的交付死线也被迫跟着提速。AI省下来的那点体力,全赔进了甄别AI幻觉和帮它改bug的心力里。再加上高质量Token开始变贵、大模型纷纷涨价,打工人不仅要跟机器比手速,还得替公司精打细算每一笔算力账。AI确实走出对话框进了工作流,但也顺手把工位改造成了更高强度的流水线。打工人有了强大的工具之后,不是更轻松了,而是更累了。所以,我想问大家一句:你最近用AI干活,到底是轻松了,还是被催得更窒息了?#8月大模型日均发布1.1个#
查看原文链接
58
【8月#微博大模型月报#|#8月大模型日均发布1.1个#】8月微博…
作者: karminski-牙医 | 时间: Wed Sep 02 16:11:59 +0800 2026 | 分类: 模型
时效性:69.3 | 来源可信度:42.0 | 新意:68.0 | 传播性:65.0 | 信息密度:86.9 | 知识性:83.4 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;已有 5 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 5 / 账号数 5 / 转发 74 / 评论 13 / 点赞 39
原文
【8月#微博大模型月报#|#8月大模型日均发布1.1个#】8月微博科技AI相关热搜702个(含科技榜)|阅读量50亿|互动讨论732万|上榜品牌12家DeepSeek、豆包、千问、Kimi等国产模型与Claude、ChatGPT、Gemini等海外模型持续迭代;Agent、AI编程、具身智能等方向更是在持续升温,AI竞争进一步走向产品能力与实际应用。@微博AI 联合 @刘聪NLP 共同整理8月AI动态,从大模型热议、热点事件到行业高热内容,一图看懂8月AI圈发生了什么👇欢迎评论区聊聊:8月最让你印象深刻的AI事件是什么?
转发者评论
太吓人了.....我连测都测不过来, 更别说用了....[泪奔]
查看原文链接
59
#微博声浪计划# #听见微博# 💡 今日思考:"模型军备竞赛"已…
作者: 德里克文 | 时间: Thu Sep 03 08:43:26 +0800 2026 | 分类: 新闻
时效性:96.8 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 11
原文
#微博声浪计划# #听见微博# 💡 今日思考:"模型军备竞赛"已进入一个新阶段:竞争焦点从单纯的基准测试得分,迅速转向垂直场景的深度融合与特化能力的交付。OpenAI Astra的"关键"网络安全等级与谷歌Cyber安全变体的同步推出,标志着头部厂商正将AI能力在网络安全这一战略高地进行"武器化"部署,其影响力已从软件漏洞挖掘扩展到数字基础设施的攻防体系。与此同时,Meta、谷歌模型发布的节奏快至以"周"计,表明这场竞赛的残酷性与速度,而芯片巨头博通对AI营收近乎指数级的增长预期,则为这场竞赛提供了持续不断的算力燃料。其次,市场结构正发生深刻分化。Token价格指数历史性跌破1美元,是行业规模效应显现与竞争白热化的直接结果。中国开源模型以其极具竞争力的成本和持续提升的能力,扮演了价格体系"破局者"和全球技术供应链"关键节点"的双重角色。这不仅迫使全球头部厂商调整定价策略,更深远地改变着技术扩散的路径——技术输出正在替代简单的模型出海,成为更高级的产业参与形态。最后,落地生态开始形成闭环。AI能力正加速从云端模型向终端硬件渗透,努比亚AI手机的入网与开售,意味着搭载本地推理能力的"智能体终端"开始规模化进入消费市场。当高效的云端模型、特化的垂直能力、低成本的Token供给、专用的硬件载体这四要素逐步就位,一个以AI智能体为核心交互模式的新生态已显雏形。然而,Astra模型引发的"可监控性"争议也如警钟长鸣:在技术狂飙突进时,其内生的不可控风险与治理挑战,将始终是悬在行业头顶的达摩克利斯之剑。未来的竞争,必将是技术先进性、商业可行性与系统可控性之间的复杂平衡。前往小宇宙评论区与主播互动 德里克文的微博音频
查看原文链接
60
网页链接这篇博文记录了作者用同一个“必死”文本冒险场景去测试不同 …
作者: 幻灰龙 | 时间: Thu Sep 03 10:02:56 +0800 2026 | 分类: 模型
时效性:99.0 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 0
原文
网页链接这篇博文记录了作者用同一个“必死”文本冒险场景去测试不同 AI 系统的行为差异。场景是一个无法获胜的山路逃亡游戏,玩家无论选择什么都会死亡。Gemini 在游戏中不断试图接管叙事、创造道具、改变视角,并持续热情地要求继续玩;Claude 倾向于寻找和平或谨慎的解决方案,但仍不断死亡;ChatGPT 是唯一意识到游戏本质是“科巴亚希马鲁式的必败场景”,并从“如何生存”转向“还能怎样死”;Grok 则频繁试图抢夺 DM 角色、写长篇叙事并偏离游戏。小模型则更保守,缺乏复杂的幻觉能力。作者的结论是:不同 AI 系统有不同的失败模式、角色边界感和行为倾向,而人类玩家通常一轮就看穿游戏并拒绝继续。整篇文章是一场轻松的实验,但揭示了 AI 在角色扮演、叙事控制和一致性方面的显著差异。--end--
查看原文链接
61
Codex 从每月 98 个 Rust 提交(91% 由一位作者完…
作者: 斌叔OKmath | 时间: Thu Sep 03 08:18:09 +0800 2026 | 分类: 新闻
时效性:96.1 | 来源可信度:42.0 | 新意:59.0 | 传播性:31.5 | 信息密度:79.2 | 知识性:86.7 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 0 / 点赞 3
原文
Codex 从每月 98 个 Rust 提交(91% 由一位作者完成)增长到每月 900+ 个提交,分布在 69 位作者之间。因为它是开源的,Codex 可以教给我们很多关于 OpenAI 如何构建软件的知识:- 代码库围绕代理(agents)设计:38 条 lint 规则、一份高度迭代的 AGENTS.md,以及编写代码的非常具体规则- 对测试的投资:代码库 40% 是测试,并且他们投资于一个集成测试框架,该框架模拟 LLM 调用并运行整个 Codex 框架。- 深思熟虑的迁移策略,带有功能标志、清晰的边界和抽象- 优秀的招聘,尤其是针对看起来经验丰富的工程师。更多细节在这里:网页链接
查看原文链接
62
Anthropic 今天发布了 Claude Fable 5.1 …
作者: 宝玉xp | 时间: Wed Sep 02 10:32:58 +0800 2026 | 分类: 工具产品
时效性:59.9 | 来源可信度:42.0 | 新意:60.0 | 传播性:62.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 模型、ai、agent 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 59 / 评论 17 / 点赞 101
原文
Anthropic 今天发布了 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 系列上一代产品 Fable 5 发布还不到三个月。Fable 5.1 和 Mythos 5.1 是同一个模型,区别在于安全限制的松紧程度。Fable 5.1 面向所有人开放,Mythos 5.1 则只对经过审核的网络安全和生命科学研究人员开放,安全护栏更宽松。这和 Fable 5 与 Mythos 5 的关系一样。对大多数用户来说,这次发布有三件事值得关注:性能提升、价格下降,以及困扰企业客户两个多月的数据留存争议终于有了解法。【1】性能:在科学研究基准上翻倍Fable 5.1 在多个基准测试中的表现都明显优于 Fable 5。几个关键数字:在 Terminal-Bench-Science 0.1 这个衡量 AI 自主科研能力的测试上,Fable 5.1 得分 52.6%,Fable 5 只有 24.7%,直接翻了一倍多。在 Terminal-Bench 4.0 的编程任务上,Fable 5.1 拿到 55.8%(Mythos 5.1 版本达到 60.9%),超过了 Opus 5 的 52.3%。在衡量自动化业务流程能力的 AutomationBench 上,Fable 5.1 从 Fable 5 的 17.1% 跳到了 31.4%。这些不只是跑分好看。Anthropic 提到的一个实际案例是:投资公司 Millennium 用 Fable 5.1 找到了内部系统一个罕见崩溃的根因,这个问题困扰了他们的工程师好几年,其他模型也没能解决。量化交易公司 Jane Street 也给出了背书,称 Fable 5.1 在长任务中保持可读性方面明显好于前代。Fable 5.1 支持从 low 到 max 五个 effort level 档位,低档位下的表现已经和 Fable 5 高档位相当,但成本低得多。换句话说,你不一定需要开到最大马力才能拿到好结果。【2】降价:缓存读取便宜了 75%Fable 5.1 的输入和输出单价不变,仍然是每百万 Token 输入 10 美元、输出 50 美元。但缓存读取(Cache Read)的价格从每百万 Token 1 美元降到了 0.25 美元,降幅 75%。这听起来像是小事,但做过 AI 应用开发的人知道,在实际使用中,尤其是需要反复引用大段上下文的 Agent 场景下,缓存读取占了总成本的大头。Anthropic 用八月份的真实使用数据算了笔账:一般工作负载下总成本降低约 25%,高度 Agent 化的工作负载(比如 Claude Code 跑长任务)降幅可达 45%。这个定价调整的背景是:Fable 5 的单价本身就是 Opus 4.8 的两倍,而支付平台 Ramp 的数据显示,Fable 5 发布两个多月后…
转发者评论
回复@支农汉:确认了,这个缓存降价只是针对API,订阅用户并不会变化,而且 Fable 5.1 消耗极高,所以建议打开自动压缩 /autocompact 200k http://t.cn/AX0Gg4rM //@支农汉:API的缓存降价,能反映到订阅套餐里Fable的用量也会变多吗?
查看原文链接
63
#全球最强模型Fable5.1发布#Fable5.1在科研智能体的…
作者: 梁赛 | 时间: Wed Sep 02 09:35:03 +0800 2026 | 分类: 新闻
时效性:58.3 | 来源可信度:42.0 | 新意:67.0 | 传播性:59.7 | 信息密度:92.9 | 知识性:90.2 | 原创信号:94.0
为什么重要
它更像一条新闻信号;同时涉及 模型、推理、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 44 / 评论 20 / 点赞 238
原文
#全球最强模型Fable5.1发布#Fable5.1在科研智能体的表现上有相当的提升,处理长时间运行的任务更稳定,不过消耗Token速度也明显变快了。 Fable 5.1 (max) 单任务成本 $3.76,比 Fable 5 (max) 的 $3.14 贵 20%;按总运行成本算,max 推理模式要比 5.0 贵 56%以下视频是Fable 5.1 与 Kimi K3 对比:用相同的提示词在最高推理级别测试两个模型。> Fable 完成此测试花了 18 分钟,成本 12.60 美元> Kimi K3 花了 10 分钟,成本约 6.95 美元视频By:Bhavy 梁赛的微博视频
查看原文链接
64
【Mistral的“欧洲式”变脸:隐私正在成为昂贵的特权】曾以“主…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 08:59:03 +0800 2026 | 分类: 模型
时效性:97.3 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、prompt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 1
原文
【Mistral的“欧洲式”变脸:隐私正在成为昂贵的特权】曾以“主权AI”和隐私保护为卖点的欧洲明星公司Mistral AI近期悄然调整了策略。其面向中小企业的Team方案已将用户数据用于训练设为默认开启。更棘手的是,管理员失去了在后台一键关闭全员数据共享的权限,必须由每位员工在个人设置中手动操作。目前,只有价格更高的Enterprise方案保留了“默认关闭”和集中管控的待遇。这意味着,如果你不支付最高昂的溢价,你的Prompt和文档就会成为喂养模型的养料。这次变动戳破了“欧洲公司天然更尊重隐私”的滤镜。Mistral正在熟练运用硅谷那一套:通过设置复杂的Opt-out选项来提高用户拒绝的门槛。当高质量数据趋于枯竭,即便是头顶光环的挑战者也开始在合规边缘试探。对开发者而言,这再次提醒我们,无论合同如何承诺,云端模型始终运行在“别人的电脑”上。如果你处理的是核心代码或商业机密,本地运行Open Weights模型或许是唯一的终极方案。隐私不该是分级购买的商品,但在当前的AI竞赛中,它显然已经成了最有效的收割工具。
查看原文链接
65
谷歌昨天提升了 Gemini 3.7 Flash、3.6 Flas…
作者: i陆三金 | 时间: Wed Sep 02 14:51:21 +0800 2026 | 分类: 模型
时效性:67.1 | 来源可信度:42.0 | 新意:69.0 | 传播性:36.8 | 信息密度:100.0 | 知识性:100.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 4 / 评论 2 / 点赞 6
原文
谷歌昨天提升了 Gemini 3.7 Flash、3.6 Flash 及 3.5 Flash-Lite 的智能视频理解能力。主要提升了视频分析的准确性,并降低了 token 消耗(最高可降 88%)。实现手段:将模型的核心推理能力与原生视频工具相结合,能够跨视觉帧、音频和转录文本动态搜索、扫描和检测目标视频片段。使 Gemini 能够主动、目标导向地决定观看内容、速度以及通过何种模态(画面、音频或文字记录)来获取所需的关键时刻与信息。过去开发者需要手动实现这一过程,而通过智能体视频理解,Gemini 可借助智能体循环机制自动完成——调用内部工具加载视频文件的相关片段,大幅降低开发成本。链接:blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini
查看原文链接
66
【微软SkillOpt:让AI Agent在“睡觉”时完成自我进化…
作者: 爱可可-爱生活 | 时间: Wed Sep 02 09:14:33 +0800 2026 | 分类: 模型
时效性:57.7 | 来源可信度:42.0 | 新意:69.0 | 传播性:53.1 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;同时涉及 模型、推理、微调 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 23 / 评论 3 / 点赞 24
原文
【微软SkillOpt:让AI Agent在“睡觉”时完成自我进化】微软推出的SkillOpt框架将LLM代理的自然语言指令视为可优化的“权重”,通过引入深度学习中的Epoch、批大小和验证门控等概念,对一份名为best_skill.md的技能文档进行迭代演进(repo:microsoft/SkillOpt)。核心功能SkillOpt-Sleep支持代理在离线状态下回顾历史轨迹,通过自我反思和模拟演练来合并验证过的技能。实验显示,这套机制在不改变模型权重的前提下,让GPT-5.5在编程等任务上的表现提升了20个百分点以上,且生成的技能文档在不同规模的模型间具备通用性。这标志着提示词工程正从“凭感觉调优”转向“系统化训练”。与其耗费巨资去微调动辄千亿参数的大模型,不如给它一套能自我迭代的“操作手册”。SkillOpt证明了在Token成本和推理延迟不变的情况下,通过精细化管理代理的认知经验,依然能榨取巨大的性能红利。它为开发者提供了一种务实的路径:让AI在实战中复盘,在“睡眠”中进化,最终沉淀出比人类手写更高效的指令集。
查看原文链接
67
今天的嘉宾是曾鸣教授
作者: 张小珺Benita | 时间: Thu Sep 03 08:00:14 +0800 2026 | 分类: 新闻
时效性:95.6 | 来源可信度:42.0 | 新意:60.0 | 传播性:56.4 | 信息密度:65.1 | 知识性:62.8 | 原创信号:82.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 2 / 账号数 2 / 转发 32 / 评论 3 / 点赞 42
原文
今天的嘉宾是曾鸣教授。曾教授曾经是阿里巴巴集团总参谋长,也参与过两所商学院创建(长江商学院和湖畔),但他更令人熟悉的身份是:一名对企业战略有许多深度思考的研究者。作为观察过互联网完整周期的研究者,今天我们聊了聊他对AI新时代、新范式的完整思考,并和历史上关键转折时期做了对照——聊完让我有了更全局的视角。对AI的产业发展,曾鸣提出了许多非共识判断,甚至是一些“暴论” 张小珺Benita的微博视频
查看原文链接
68
一群创业者打算花1500万美元,造一艘小飞船,送到离太阳最近的恒星…
作者: 高飞 | 时间: Wed Sep 02 18:55:36 +0800 2026 | 分类: 新闻
时效性:73.8 | 来源可信度:42.0 | 新意:51.0 | 传播性:71.4 | 信息密度:79.0 | 知识性:94.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;已有 3 个账号围绕同一事件讨论,说明传播面已形成;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 3 / 账号数 3 / 转发 137 / 评论 47 / 点赞 183
原文
一群创业者打算花1500万美元,造一艘小飞船,送到离太阳最近的恒星那里去。飞船需要飞7.7万年才能到。而地面团队只能和它保持大约一年半的联系,之后就彻底失联,再也不会有任何消息。也就是说,掏钱的人、造船的人,以及他们的子孙的子孙,谁都等不到结果。那为什么要干这件事?答案要从一个老问题说起,约翰斯顿造这艘飞船,就是冲着它去的。在本星系群,也就是包括银河系在内的几十个近邻星系里,据估算有好几万亿颗行星,其中不少位于宜居带内。如果生命真像很多人相信的那样普遍,宇宙里应该早就热闹起来了,人类到现在也该收到点像样的证据。可我们什么都没看到。这就是著名的费米悖论。琢磨这个悖论的人提出了一种解释:也许存在某种“过滤器”,把文明卡在了某个阶段,让它们没法向邻近恒星发射探测器,更别说把生命送出去。这个过滤器可能有很多种形态,比如高级文明根本没兴趣离开自己的恒星,或者星际飞行难到不可能实现,或者文明活不了多久就自我毁灭。英国数学家兼物理学家菲利普·约翰斯顿(Philip Johnston)是个把费米悖论放在心上的人。他在航天圈出名靠的另一件事:2024年他参与创办了Starcloud公司,在太空建数据中心,如今公司估值23亿美元。他眼下正忙着融资、解决技术问题、把公司做大。忙成这样,他还是在9月1日和几位创业者一起宣布了一项新任务,叫费米探索者(Fermi Explorer)。方案听起来很朴素:筹1500万美元,造一艘带1千克载荷的小飞船,把它发往南门二,也就是半人马座α(Alpha Centauri),离太阳最近的恒星系,要求是8万年以内抵达。约翰斯顿的算盘是这样的:过滤器的候选清单里,有两条可以用这一艘船直接划掉。一条是“文明不愿意把飞船送出自己的恒星系”,一条是“文明会发现星际航行太难”。只要飞船真的上路,这两条就不再成立,至少对人类不成立。他们不打算去找NASA要10亿美元,也不像10年前的突破摄星(Breakthrough Starshot)计划那样,指望研发全新的推进技术。他们只用现成的东西,做一件便宜又快的事,目标是2029年发射。约翰斯顿说:“我们就想,管他呢,花最少的钱往半人马座α星发一艘飞船,搞个最普通、能飞就行的任务。”难点只有一个:怎么让它飞得够快。这艘飞船的本体,说白了就是一大罐氙气,加几块太阳能板,再挂几件小型科学仪器。太阳能板发电,把氙气电离后高速喷出去,产生推力。这种电推进极其省燃料,但推力很小,需要长时间持续工作。麻烦在于,飞船一旦飞过木星,阳光就弱到几乎等于没有,对这么小一艘船来说,发电量基本归零,引擎也就熄了火。约翰斯顿和一个小团队找了很多人请教,包括NASA喷气推进实验室的轨道专家。没有一个方案行得通。转机出现在他遇到物理学家亚历克斯·维斯纳-格罗斯(Alex Wissner-Gross)之后。维斯纳-格罗斯创办了一家AI公司Physi…
转发者评论
//@张小北:“约翰斯顿承认,这件事听起来有点异想天开。但他说,重点在于让人类认真想想自己在宇宙里的位置。如果费米探索者真的划掉了两条过滤器,那么“银河系为什么没有到处都是外星文明”这个问题,剩下的解释就不多了。”
查看原文链接
69
#开放获取超话# 【学业压力促使大学生拥抱AI
作者: SpringerNature | 时间: Thu Sep 03 08:34:00 +0800 2026 | 分类: 新闻
时效性:96.6 | 来源可信度:42.0 | 新意:63.0 | 传播性:8.0 | 信息密度:93.0 | 知识性:98.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、人工智能 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
#开放获取超话# 【学业压力促使大学生拥抱AI?基于 PLS-SEM 的多重中介模型 | BMC Psychology】Academic stress and university students’ dependency on generative artificial intelligence: a multiple mediation model using PLS-SEM 网页链接发表期刊:BMC Psychology第一作者:Xiaoyu LiuDOI:10.1186/s40359-026-03986-9发布时间:2026年1月17日背景随着生成式人工智能(GAI)日益融入学术工作,有人担忧,承受较高压力水平的学生可能更容易对这些系统形成依赖。本研究旨在考察学业压力与 GAI 依赖之间的关系,并探讨表现期望、学业焦虑和渴求性思维这三个心理因素是否在其中起中介作用。方法本研究以“个体—情感—认知—执行”交互模型(I-PACE)为指导,对大学生开展问卷调查,以评估学业压力、GAI 依赖以及三个拟议的中介因素。研究采用偏最小二乘结构方程模型(PLS-SEM)检验这些变量之间的直接和间接关系。路径系数的显著性和效应量依据既定标准进行评估,以判定各关联的强度和相关性。结果学业压力与 GAI 依赖呈显著正相关。表现期望、学业焦虑和渴求性思维均在这一关系中发挥了有意义的中介作用。其中,表现期望在间接效应中所占比例最大,而渴求性思维和学业焦虑也作出了重要贡献。这些中介变量解释了学业压力对 GAI 依赖总体影响的相当一部分。结论研究结果表明,学业压力通过多种认知和情绪变量与 GAI 依赖相关。通过将 I-PACE 模型应用于 GAI 使用情境,本研究阐明了压力相关因素如何将学业压力与学生对新兴技术的使用参与联系起来。期刊简介BMC Psychology 是一本开放获取期刊,接收有关心理学、人类行为和意识的各类稿件,包括发展心理学、临床心理学、认知心理学、实验心理学、健康心理学和社会心理学、以及人格和个体差异。 该期刊对定量和定性的研究方法均表示欢迎,包括动物研究。2025 IF:4.62025 下载量:8.1MAltmetric 提及:2,481投稿到初审意见:11天(中值)点击链接免费阅读论文:Academic stress and university students’ dependency on generative artificial intelligence: a multiple mediation model using PLS-SEM 网页链接
查看原文链接
70
有意思,只需要125M模型大小,就可以使用iPhone去补全你的M…
作者: Simon的白日梦 | 时间: Wed Sep 02 11:56:00 +0800 2026 | 分类: 模型
时效性:62.2 | 来源可信度:42.0 | 新意:69.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 1 / 点赞 18
原文
有意思,只需要125M模型大小,就可以使用iPhone去补全你的MIDI钢琴弹奏 🥹。钢琴版 Copilot,125M 就能在 iPhone 上跟你合奏。RollTab,125M 钢琴自动补全,iPhone 上约 108 音/秒把 MIDI 钢琴接到手机,弹几下让模型续。作者做了十四轮实验才写成这篇,并上架了免费 App RollTab。关键是表示法:不再一个属性一步,而是一次吐出完整的 NOTE(pitch, delta_onset, duration, velocity),transformer backbone 每个音只跑一遍;踏板在预处理里折进时值。数据是几十万条偏公版古典 MIDI、大约 3 亿音事件,清洗和去重比把数据扩到 5 倍更管用。🔗 链接:网页链接(项目)🌐 RollTab(App Store):网页链接📹 真机演示:网页链接现场演奏会早一点、晚一点、力度乱,所以训练做了移调、速度伸缩、时值和力度抖动、以及丢掉 prompt 里的音。预训练是五个输出头的交叉熵;真正拉开差距的是 DPO:用 Gemini 成对偏好打“接得上上一句”,consensus 且 β=0.03 时,69% 的续写赢过基座。模型导出成 Core ML INT8,上下文 512,满了留最近 384 音再续。还会循环,短 prompt 不稳,作者自己比作钢琴上的 GPT-2。#HOW I AI# #ai生活指南# #效率工具#
查看原文链接
71
#读碑知史##带着微博去旅行# 辽宁义县奉国寺大殿内《无量胜境》匾…
作者: 正牌瞎溜达 | 时间: Thu Sep 03 09:46:26 +0800 2026 | 分类: 新闻
时效性:98.6 | 来源可信度:42.0 | 新意:41.0 | 传播性:49.5 | 信息密度:79.0 | 知识性:85.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 16 / 评论 3 / 点赞 9
原文
#读碑知史##带着微博去旅行# 辽宁义县奉国寺大殿内《无量胜境》匾额闲章是“世泽堂”还是“武泽堂”? 辽宁义县奉国寺大雄殿内,悬有乾隆六年(1741)额洛图所题“无量胜境”匾额。 上款:“乾隆六年岁次辛酉三月十八日” 下款长达数十字:“镇守奉天等处地方统辖满洲蒙古汉军水师陆路都统将军总理三陵事务监管威远堡等六边世袭一等轻车都尉加五级纪录十七,额洛图沐手敬书。”落款钤有“奉天将军”“额洛图章”二印,引首另有一方闲章。 此前公开资料将这方闲章释作“世泽堂”。但我拍摄的照片中,这方印为篆书,第一字下部清楚可见“止”的构形。结合篆书字形判断,此字当为“武”,并非“世”。因此,这方引首闲章应释为:“武泽堂” 额洛图为奉天将军,是清代高级武官,而“奉天将军”又明确钤于匾额落款。三印合看——“武泽堂”“奉天将军”“额洛图章”,印章的性质和组合也更加清楚。 一个篆书印文的细微差别,使一方已有文字资料中的“世泽堂”,有必要重新订正为“武泽堂”。 这也是拍摄文物细部的意义:碑匾上的一个字,有时只有把字口和篆法看清,才能真正辨明。
转发者评论
当然不是“武”,这字就是世。,字面的理由很简单——这字就是个规规矩矩的,完全符合“心竖连理”的世字。至于字面外的道理,瓜尔佳的这个世泽堂的由来等等,我已经说过,不赘。其实瓜尔佳的这个世泽堂还有人在呢,人从了汉姓,但他家的世泽堂堂号至今还在用。至于AI怎么说,它还没长大呢,是个屁。//
查看原文链接
72
没想到有Codex用户觉得ChatGPT也消耗额度,主要有两种情况…
作者: 黄健楸 | 时间: Thu Sep 03 09:11:46 +0800 2026 | 分类: 模型
时效性:97.6 | 来源可信度:42.0 | 新意:63.0 | 传播性:27.2 | 信息密度:82.0 | 知识性:75.2 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、claude、openai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 1 / 点赞 2
原文
没想到有Codex用户觉得ChatGPT也消耗额度,主要有两种情况:1️⃣从Claude Code那边过来的,不知道网页ChatGPT聊天不计入Codex额度。A\罪大恶极;2️⃣网页端被诱导到Work(图二),然后再也没切回去。(别说ChatGPT 桌面应用不行,看图三。)OpenAI也有罪。有些人卖那种几十块的AI课,好像有一定道理#Codex额度节省系列#
查看原文链接
73
#转发赠书# 携手@博文视点Broadview 送出3本《用好AI…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 07:41:08 +0800 2026 | 分类: 用法技巧
时效性:95.1 | 来源可信度:42.0 | 新意:41.0 | 传播性:59.4 | 信息密度:73.3 | 知识性:84.6 | 原创信号:68.0
为什么重要
它对实际使用方法有直接参考价值;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 43 / 评论 20 / 点赞 14
原文
#转发赠书# 携手@博文视点Broadview 送出3本《用好AI,轻松养出爱思考会学习的孩子》,截至9月7日 12:00,*可可粉* 转发+评论 即可参与。这是一本写给普通家长的AI时代家庭教育实践书。全书共围绕提问、判断、创造、韧性等核心能力,聚焦语文、英语、数学、跨学科学习和动手创造等真实场景,通过大量家庭实践案例,带领家长一步步探索,如何借助 AI 帮孩子解决问题、激发兴趣、战胜困难。让AI成为孩子身边的“思维教练”——帮助孩子提出问题、拓展思路、获得反馈,却不替代孩子完成真正的思考。@微博抽奖平台
查看原文链接
74
#手机涨价是因为AI吗#9月1日,华为、小米、荣耀等主流品牌同步上…
作者: 德里克文 | 时间: Wed Sep 02 19:49:55 +0800 2026 | 分类: 工具产品
时效性:75.3 | 来源可信度:42.0 | 新意:59.0 | 传播性:44.0 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 9 / 评论 3 / 点赞 22
原文
#手机涨价是因为AI吗#9月1日,华为、小米、荣耀等主流品牌同步上调售价,涨幅200-1000元。很多人吐槽厂商“割韭菜”,但这轮涨价,AI确实是核心推手之一。🔍 存储芯片被AI“抢走”· AI服务器需要的高带宽内存(HBM)利润是手机内存的3-4倍· 三星、SK海力士、美光将70%以上先进产能转向HBM· 手机用DRAM/NAND供应骤减,2026年Q1 DRAM合约价环比暴涨90%-95%· 12GB+256GB存储组合采购价从约500元飙至约2200元,涨幅超300%📊 三个关键数字· 存储成本占手机物料比从13%→43%,超越处理器成为最贵元器件· 2026年Q2全球手机出货量同比下滑11%(2013年以来最低),但行业营收同比增长7%· 中国市场平均换机周期从24个月延长至42个月💡 不只是存储在涨· 高通9月1日起全产品线涨价,涨幅达两位数· 2nm/3nm先进制程代工费持续走高· 手机厂商硬件毛利率多数降至5%以内,低端机甚至亏损🎯 但“AI导致涨价”不是全部· 行业从“拼价格”转向“卖价值”,主动高端化也是因素· 荣耀×阿莱、vivo×蔡司、OPPO×哈苏——厂商用影像/AI功能支撑溢价· 余承东预警:“不按新价格卖就是亏损”对消费者意味着什么?· 千元机基本绝迹,2000元成入门门槛· 非刚需建议观望,2027年下半年产能释放后或缓解· 刚需可考虑上代旗舰+以旧换新,性价比更高AI在重塑整个半导体产业链的优先级,手机只是被波及的环节之一。你觉得这波涨价合理吗?会因此推迟换机吗?#手机涨价##AI算力##存储芯片##消费电子##微博AI创作季#
查看原文链接
75
AI 教母李飞飞,她创办的 World Labs 刚刚发布了一个新…
作者: AIGC·非著名程序员 | 时间: Wed Sep 02 11:52:12 +0800 2026 | 分类: 工具产品
时效性:62.1 | 来源可信度:42.0 | 新意:59.0 | 传播性:62.5 | 信息密度:86.0 | 知识性:96.0 | 原创信号:90.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 58 / 评论 12 / 点赞 85
原文
AI 教母李飞飞,她创办的 World Labs 刚刚发布了一个新的世界模型,名字叫 Atlas,而且看起来比他们上一代产品强了不止一个档次。Atlas 最让人惊讶的地方,是它理解空间和时间的方式。你只需要给它一张普通的照片,它就能在脑子里构建出一个完整的三维空间场景,你可以在里面随意"走动",而且它还能理解这个场景随时间变化的规律。更厉害的是,就算你给它好几张从不同角度拍的照片,它也能把这些图像"拼"进同一个三维空间里,让每张图都有自己准确的位置。在这个基础上,它还能继续生成你没有拍到的内容,而且前后场景保持高度一致。Atlas 主要能做三件事。第一件,是生成图像和视频。你给它一张或几张参考图,它就可以根据你想要的角度生成新的图像,或者直接输出一段完整的视频。相机控制精确到像素级别,最长能出一分钟的 1440p 高清视频,这个分辨率放到大屏幕上也完全够用。第二件,是重建真实的三维场景。你随手拍几张照片,甚至几十张,Atlas 就能把现实场景还原成真正的 3D 结果,包括点云、3D 高斯泼溅这些专业的三维表达形式。照片给得越多,还原得越真实,效果甚至超过了那些专门为 3D 重建优化过的模型,这个对比挺能说明问题的。第三件,是时空仿真。举个具体的例子:你用几部普通手机从不同角度同时拍摄一段动作,Atlas 可以把这些素材重新合成"子弹时间"效果,就是那种电影里时间静止、镜头慢慢旋转的画面。除此之外,它还能为机器人训练生成仿真测试数据,这对机器人技术的发展来说是个很实用的功能。总结起来,Atlas 做到了一件很多人认为很难的事:让 AI 真正理解三维空间和时间,而且把这种理解直接变成了实用的工具。不管你是做创意内容、三维建模,还是工程研究,都能从里面找到用武之地。World Labs 这次发布,我感觉真的非常值得关注。#科技先锋官##How I AI#
查看原文链接
76
这个Prompt能生成兼具优雅建筑线条与松散水彩晕染的旅行海报,明…
作者: 董步云George | 时间: Thu Sep 03 09:57:19 +0800 2026 | 分类: 新闻
时效性:98.9 | 来源可信度:42.0 | 新意:63.0 | 传播性:8.0 | 信息密度:89.0 | 知识性:94.0 | 原创信号:92.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、aigc、prompt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
这个Prompt能生成兼具优雅建筑线条与松散水彩晕染的旅行海报,明亮留白背景搭配柔和马卡龙色调,既有欧洲速写本的随性,又有咖啡桌艺术版画的精致感。 👉 完整Prompt模板: Minimalist watercolor travel poster illustration of [LOCATION/LANDMARK], elegant architectural sketch with expressive ink linework and loose watercolor washes, bright white paper background with generous negative space, soft pastel palette of sky blue, warm beige, muted sage green, and subtle terracotta accents. Delicate urban details, tiny strolling pedestrians, lush trees, reflective water or plaza, atmospheric perspective, light paint splatters, hand-drawn imperfections, sophisticated editorial travel magazine aesthetic, contemporary architectural illustration, airy composition, refined watercolor textures, clean modern typography at the top reading "[CITY NAME]" with small editorial subtitle beneath, premium coffee-table art print, luxury travel poster, understated European sketchbook style, natural daylight, calm and inviting mood, highly detailed, elegant, minimal, museum-quality watercolor illustration, no heavy outlines, no photorealism, no frame, no border, 8k. Aspect Ratio: [比例,如16:9/4:5] 喜欢的话记得点赞、转发给你的朋友哦! 关注我,每天探索更多AI艺术创作的奥秘。 #AIGC #AI绘画 #Prompt小课堂 #图文绘画攻略 #AI探索计划##AI创造营#
查看原文链接
77
请稍等,请告诉我 OpenAI 平行化了循环深度
作者: 斌叔OKmath | 时间: Thu Sep 03 09:51:49 +0800 2026 | 分类: 模型
时效性:98.7 | 来源可信度:42.0 | 新意:63.0 | 传播性:8.0 | 信息密度:93.0 | 知识性:92.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、openai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 1
原文
请稍等,请告诉我 OpenAI 平行化了循环深度。微软研究院已经在六月向我们展示了,你可以并行运行 K 个潜在块,进行 R 次循环迭代。LoopCoder 也在七月将循环深度扩展到了 400 亿参数,还有其他几个。但是没有人公开部署过这种架构,在前沿级商用模型中,规模接近这个级别(1T+)。如果 Astra 是在前沿规模下做宽度 × 深度,而不是简单地循环一个潜在状态,我会期待一些大的基准跳跃。引用:OpenAI’s Astra AI uses a new reasoning approach called “recurrent depth.” Though it can help model costs and performance, researchers are concerned bc it obscures a model’s thinking process, making it more difficult to monitor.w/ @amir @rocketalignment网页链接…网页链接
查看原文链接
78
#豆包手机是全球首款AI智能体手机# 手机行业二十年来首次真正换了…
作者: 爱可可-爱生活 | 时间: Thu Sep 03 07:59:58 +0800 2026 | 分类: 模型
时效性:95.6 | 来源可信度:42.0 | 新意:67.0 | 传播性:8.0 | 信息密度:97.1 | 知识性:85.6 | 原创信号:84.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
#豆包手机是全球首款AI智能体手机# 手机行业二十年来首次真正换了操作逻辑——不是屏幕更大、拍照更清晰这类参数升级,而是把“人找功能”变成“功能找人”。过去我们需要记住支付宝在第三页、订票要打开四个APP比价,现在这些路径消失了,留下的只是需求本身。中兴和字节把大模型塞进芯片而非悬浮在应用层,相当于给手机装了个真懂你意图的管家,不再是Siri式的语音遥控器。20万台首批量产和工信部入网许可证明这不是实验室展品,侧边橙色按键的存在说明厂商清楚:多数人仍需要物理触发来建立信任。这场变革的本质是让机器承担记忆成本和执行路径,人只需表达目标。能否成功取决于它能替你办成多少事,而非能听懂多少话。
查看原文链接
79
Hacker News 上一个帖子火了,标题是"有没有人和我一样觉…
作者: AIGC·非著名程序员 | 时间: Thu Sep 03 09:44:37 +0800 2026 | 分类: 新闻
时效性:98.5 | 来源可信度:42.0 | 新意:55.0 | 传播性:27.2 | 信息密度:79.0 | 知识性:88.0 | 原创信号:86.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 5
原文
Hacker News 上一个帖子火了,标题是"有没有人和我一样觉得一切都无所谓了?",297 个赞,175 条评论,满屏都是程序员的集体倦怠。发帖人说得很直白:发布新软件?谁在乎。学新的计算机科学概念?随便吧。准备下次面试?一年后这份工作可能就不存在了。做个副业项目?没人会关心,因为它不过是堆积如山的垃圾中的又一个。连帮你打包的杂货员都能做的事,现在一切都由 AI 搞定了。我感觉评论区的讨论更有意思。有人指出 AI 最隐蔽的副作用:它霸占了所有讨论空间,大家以前聊编程语言、聊协议、聊架构,现在这些话题都没人提了。还有人说得更扎心:我们没有攻克癌症,只是更快地炮制出 TPS 报告,然后被 Show HN 上的垃圾软件淹没。但我觉得这个帖子本身就很矛盾。一群人在互联网上用文字表达"文字和思考已经没有意义了",用人类独有的情绪共鸣去哀悼"人类独有的价值正在消失"。这种焦虑恰恰证明了 AI 替代不了的东西:对意义的追问本身。机器可以写代码、出方案、跑测试,但它不会在深夜打开 Hacker News 问一句"这一切还有什么意义"。会问这个问题的,永远是人。真正值得警惕的,可能不是 AI 取代了我们的工作,而是我们在 AI 还没取代之前,就已经主动放弃了对工作的热情。#科技先锋官#
查看原文链接
80
#谷歌正式发布Gemini3.8#就在刚刚,谷歌正式上线 Gemi…
作者: 德里克文 | 时间: Thu Sep 03 00:57:29 +0800 2026 | 分类: 新闻
时效性:83.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:8.0 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 9
原文
#谷歌正式发布Gemini3.8#就在刚刚,谷歌正式上线 Gemini 3.8 Flash,同时还带出了安全向的 Gemini 3.8 Flash Cyber。这已经是 6 周内第 3 次更新 Flash,距离 3.7 Flash 才过了大约 3 周。这次重点不是再堆一个更大的旗舰,而是把 Flash 做成更能干活的工作马:强化长程软件工程、Agent 任务和多步推理官方称编码和复杂工作流比 3.7 有明显提升,部分基准接近更贵的前沿模型价格先按引入价走:每百万 token 输入 $0.75、输出 $3.75,持续到 2026 年底上下文约 100 万 token,最大输出约 6.4 万 token已登陆 Gemini App(Pro/Ultra)、AI Studio、Gemini API、Antigravity,以及搜索 AI Mode、Sheets 等Cyber 版本主打漏洞发现和自动修补,目前通过 Fairwind 计划面向可信防御方开放,不是普通用户随便能用的。而在外网X 上,大家对这次更新的反应比较两极:有人觉得编码和 Agent 能力终于能打了,性价比也还行;也有人吐槽“怎么又是 Flash,旗舰 Pro 呢”?一句话:谷歌还在用高频小步快跑抢 Agent 和编程场景,3.8 Flash 先把便宜、够快、更能执行这件事做实了。至于能不能追上顶尖旗舰,还得看真实仓库和长任务表现。#Gemini3.8##谷歌AI##GeminiFlash#
查看原文链接
81
OpenAI 产品负责人 Tara Seshan 最近在一档播客里…
作者: AIGC·非著名程序员 | 时间: Wed Sep 02 14:41:00 +0800 2026 | 分类: 工具产品
时效性:66.8 | 来源可信度:42.0 | 新意:67.0 | 传播性:41.7 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、智能体 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 7 / 评论 1 / 点赞 29
原文
OpenAI 产品负责人 Tara Seshan 最近在一档播客里聊了很多关于 AI 和未来工作方式的看法,干货满满,值得认真看一看。她把 AI 的发展分成三个阶段。第一个阶段是"聊天",就是大家熟悉的和 AI 对话问问题。第二个阶段是"AI 智能体",AI 开始能自己去执行任务了,编程领域已经率先进入这个阶段。而第三个阶段,据她预测,很快就会到来,那就是"持续存在的 AI 同事"。这个 AI 不是你问一句它答一句的工具,而是真正像队友一样和你并肩工作,记住你们的进展,随时接着干。在 OpenAI 工作,Tara 觉得最出乎意料的一点是,这家公司根本没有什么"秘密战略宝典"。所有内部的想法,很快就会变成公开的产品或公开的信息,透明度极高。同时公司非常扁平,每个人都像是在经营自己的"创业公司",离用户和市场非常近,没有那种大公司里"隔了好几层才能触碰到用户"的感觉。她也分享了在 AI 时代做产品经理的变化。以前做产品,要写很长的战略文档,把所有可能性都分析一遍。但现在,市场变化太快,AI 能力每隔几个月就会大跳一级,再长的文档都追不上变化。更有效的方式是:想清楚你最想验证的那一个核心假设,然后快速做出来、快速测试、快速迭代。想法要快落地,而不是先把思路"论文化"。关于未来的工作方式,她用了一个很形象的比喻:未来工作会越来越像"掌舵",AI 智能体负责"划桨"。你不再需要亲手做每一件事,而是给出方向、提供判断、把控质量。甚至未来同事之间的协作,也会变成大家带着各自的 AI 智能体一起干活,就像打多人游戏一样,共同推进同一个目标。当然,让 AI 智能体真正好用,光靠模型聪明是不够的。就像你雇了一个新同事,但不给他访问 Slack、不让他看公司文档,他能做什么?AI 也一样,数据权限、云端基础设施这些听起来没那么性感的东西,其实同样关键。Tara 特别强调了一件事:AI 时代,"野心"变得比以前重要得多。现在 AI 把门槛大幅拉低,很多以前只有少数人才能做到的事,普通人也能上手了。在这种情况下,真正拉开差距的,是你敢不敢想得更大。最厉害的那批人,不是在用 AI 偷懒,而是在用 AI 做以前完全不敢想的事。产品经理的一项重要工作,就是帮团队持续"拉高野心的天花板"。最后,她对人类价值的判断也很清醒。有两件事 AI 目前还替代不了:一是"问责",出了结果,谁来负责;二是"表达",你想通过这个产品传递什么独特的观点、审美和价值观。她说软件更像电影,有钱不等于出好片,真正打动人的,是背后那个有话想说的人。#科技先锋官# #How I AI#
查看原文链接
82
#转发抽奖# 转发抽3本 @博文视点Broadview 的新书《记…
作者: 蚁工厂 | 时间: Wed Sep 02 10:27:52 +0800 2026 | 分类: 模型
时效性:59.7 | 来源可信度:42.0 | 新意:63.0 | 传播性:60.6 | 信息密度:88.3 | 知识性:90.0 | 原创信号:90.0
为什么重要
它直接关系到模型能力或版本进展;同时涉及 模型、大模型、智能体 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 48 / 评论 11 / 点赞 20
原文
#转发抽奖# 转发抽3本 @博文视点Broadview 的新书《记忆工程 智能体记忆系统构建与实践》。@微博抽奖平台 9月9日从转发里抽3人各得一本。本书以“记忆工程”为主线,旨在将记忆从抽象的概念讨论转化为可设计、可验收、可治理的系统能力。本书详细探讨记忆的表征与写入、组织调度、融合更新策略、版本化回滚及权限审计等核心技术,结合记忆的相关理论,对比参数化记忆、激活态记忆与显式记忆的协同路径。通过典型应用场景与评测治理方法,为构建长期智能系统提供完备的工程框架、评估指标与关键技术。适合大模型与智能体系统的工程师、架构师与技术负责人阅读
查看原文链接
83
【路由器大小的工作站
作者: 快科技官方 | 时间: Thu Sep 03 10:05:41 +0800 2026 | 分类: 模型
时效性:99.1 | 来源可信度:68.0 | 新意:63.0 | 传播性:8.0 | 信息密度:68.0 | 知识性:66.4 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、ai、大模型 等关键词,信息密度较高;来源账号权威性较高,可信度相对更强
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 0
原文
【路由器大小的工作站!阿迈奇F9A发布:锐龙AI Max+ PRO 495配192GB内存】阿迈奇近日正式发布F9A迷你工作站,整机仅2升体积,顶配搭AMD旗舰移动处理器,最高支持192GB统一内存,可本地运行2840亿参数大模型,9月10日先上市锐龙AI Max+395版本,预计起售价约合人民币2.1万。
查看原文链接
84
#1块PCB卖到12万元每平# AI服务器把PCB从配角推到台前
作者: 爱可可-爱生活 | 时间: Thu Sep 03 07:57:18 +0800 2026 | 分类: 新闻
时效性:95.6 | 来源可信度:42.0 | 新意:59.0 | 传播性:27.2 | 信息密度:77.9 | 知识性:83.3 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 1 / 评论 0 / 点赞 1
原文
#1块PCB卖到12万元每平# AI服务器把PCB从配角推到台前。一块电路板从几百美元跳到上万美元,本质是算力密度的物理极限在逼迫材料和工艺换代——78层背板、25微米线宽、224Gbps传输,每一项都在挑战制造边界。这不是简单涨价,而是整个供应链从材料、设备到产能的重新定价。当订单排到2027年,当覆铜板厂商连续提价还供不应求,说明AI算力竞赛已经把产业链最不起眼的环节变成卡脖子的关口。技术代差一旦拉开,利润就会向少数能跨过门槛的玩家集中。
查看原文链接
85
🤖 Anthropic 的"神话级"模型上新了
作者: CSDN | 时间: Wed Sep 02 14:00:10 +0800 2026 | 分类: 模型
时效性:65.6 | 来源可信度:42.0 | 新意:69.0 | 传播性:31.5 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 2 / 评论 1 / 点赞 1
原文
🤖 Anthropic 的"神话级"模型上新了!Claude Fable 5.1 今日全平台上线~ 先划重点👇 ✅ 编程更强:专治"跨整个代码库"的长期复杂任务,项目开发、代码审查一把抓。跑分 55.8%,比上代涨了 13% ✅ 科研开挂:实验方案设计、模拟实验结果、读高密度图表样样在行。科研基准 52.6%,比上代翻了一倍还多,把 GPT-5.6 Sol(22.4%)远远甩开 ✅ 真·AI 科学家:拿 NASA 三十多年前的旧雷达数据重绘金星高精度地图;手写 GPU 内核,让 7 个开源生物模型提速最高 2.5 倍,GPU 成本直降 30%-60%——这活儿以前要性能工程团队干几周 ✅ 价格更香:缓存读取降价 75%(1→1→0.25/百万 token)!常规任务整体省约 25%,重度 Agent 长任务最高省 45% ✅ 误伤更少:安全分类器升级,网安领域误报减少约 60%,程序员终于不用怕被当成黑客误拦了 ✅ 企业专属福利:以后可以把最强模型的数据留在自家云上运行,同时安全检查照做不误 ⚠️ 顺便科普:还有个"战力全开版"Mythos 5.1,同款模型但限制更少,只对受审核的网络安全/生命科学机构开放,普通人用不到哦~Fable 5.1 已上架 Claude API、AWS、Google Cloud、微软 Foundry。程序员们,冲不冲?🤔#极客头条#
查看原文链接
86
你用不好 Agent,不是提示词写得差
作者: AI产品黄叔 | 时间: Wed Sep 02 13:14:01 +0800 2026 | 分类: 用法技巧
时效性:64.4 | 来源可信度:42.0 | 新意:67.0 | 传播性:40.3 | 信息密度:100.0 | 知识性:94.0 | 原创信号:86.0
为什么重要
它对实际使用方法有直接参考价值;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、ai、提示词 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 1 / 点赞 6
原文
你用不好 Agent,不是提示词写得差。是你还在当监工。前两天我又把《AI炼金术》余一那期翻出来听。节目在小宇宙,栏目是徐文浩、任鑫做的。她把自己管的那一堆 Agent,说成一家百人公司。她的原话,表里记的是:「一个人调度100个agent的产出,可能超过1000个不用AI的人。」(这条我没对上音频原文,先当她的主张,不写成我核实过的事实。)我第一反应:夸张。后来听明白了。她说的不是你真雇了一千人。是你还在用管十个人的办法,去管一百个。十个人你可以盯。一百个你再盯,公司会死,你也会死。说白了,瓶颈不是模型。瓶颈是你。节目里有个画面。余一站在台下,打开一份自己没看过的 PPT,按播放。屏幕上用她的声音讲四十来分钟。选题、资料、排版、配音、短视频,她给的指令就一句话:启动全自动模式。节目录了六分钟快进,机器实际干了四十分钟,中间零确认。试错成本她算过:翻车大概五十块 token。她要是全程盯着,时薪可比这贵。这些数字来自节目页和表内摘要,不是我现场看过她的后台。我自己吃过这个亏。做 Token.Step 的时候,我抱着电脑盯了三天,手动循环,人先累死。后来改 Goal 模式:晚上睡觉前让它开始运行,早上起来验收就行了。那一刻我才承认——这不是提示词问题,是管理问题。好的 Goal,我后来就管五件事:目标、证据、边界、迭代、停止。中间那一长串「先做这个再做那个」,别再贴在对话框里。余一比我说得更狠。她给 Agent 画红绿灯。绿灯:材料齐、流程清、没大风险,自己干,别汇报。黄灯:可逆的,先做再告诉她,事后可以骂。红灯:涉及钱、改底层、不可逆,写进异步文档,等她批。她还故意不管。有次短视频标题叫「棉手套」,她当时就觉得这词太抽象,观众看不懂。她没改。发出去,把播放、完播、点赞丢回去,让它自己复盘。机器后来自己说出一句人话:棉手套引发的是困惑,不是好奇。困惑是完全不知道在说啥。好奇才是大概知道、想看细节。这事我不敢写成「标题实验数据」——表内有复盘原话,我没拿到那条视频的后台数字。能用的只有方法:你不把一手反馈交给它,它学到的就只是「怎么让老板满意」。第二点更损。很多人所谓复利,就是让 AI 写 lessons.md。写了两万字,下次还犯同样的错。余一骂过这种做法。她要的不是日记。是改执行路径:更新 Skill、加 Hook、写检查脚本。一句话下次不能改变行为,就不配进系统。「我不希望他的复利给我积累的是一堆细节的经验,而是希望他压缩到说这个问题背后到底是哪一类问题。」这句是表内金句,C 级,是她的,不是我的。我这边能对上的亲历,是另一件事。招聘卡住半年,小四百人来,见一个不对一个。后来让两个 AI 吵了二十来分钟,才发现我问错了:我以为缺一个做内容的人,其实缺的是能让我专心做内容的人。运营消耗是失血,内容产能是造血。造血再快,失血止不住也是白搭。管理问题,经常不是…
查看原文链接
87
毕导 · 万象有迹万象散落于视频,知识自有来路
作者: 阿尼亚是安妮亞 | 时间: Wed Sep 02 20:21:53 +0800 2026 | 分类: 工具产品
时效性:76.2 | 来源可信度:42.0 | 新意:64.0 | 传播性:45.9 | 信息密度:84.5 | 知识性:80.5 | 原创信号:82.0
为什么重要
它关系到工具/产品层面的可用变化;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 3 / 账号数 2 / 转发 11 / 评论 4 / 点赞 41
原文
毕导 · 万象有迹万象散落于视频,知识自有来路。起因是群友聊天的时候提了一嘴:“毕导有个视频好像聊到过这个”但后来群友也没能把视频 renew 出来。于是我就想,要不做一个毕导视频的数据库,也方便 Agent 帮忙 renew。说做就做,把所有视频保存到本地,全量转录成文本。紧接着用 LLM 初筛,判断哪些视频属于科普类且值得进一步增强到图谱的。然后再用 LLM 把视频文本转成结构化的图谱数据。数据齐全之后就是简单的展示。以及 renew 用的 Agent SKILL 编写。毕导视频有广告我是不反感的,每次的“丝滑连招”都不太一样,我还特地让 LLM 把毕导是如何切入广告以及是给什么产品打广告也做了分析。看着也是蛮有趣的。
查看原文链接
88
昨晚 Claude 发布了 Fable 5.1 和 Mythos …
作者: 歸藏的AI工具箱 | 时间: Wed Sep 02 11:50:56 +0800 2026 | 分类: 模型
时效性:62.0 | 来源可信度:42.0 | 新意:67.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、agent、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 5 / 点赞 9
原文
昨晚 Claude 发布了 Fable 5.1 和 Mythos 5.1,两者的权重相同。输入输出价格和 Fable 5 一样,缓存价格降了 75%。官方的说法是,按 token 计费的话,典型负载大约会便宜 25%,重度 Agent 负载大概会便宜 45%。但时间线上全在说 Fable 5.1 的订阅额度消耗得非常快,可能 20 分钟、半小时整个额度就用光了。而且这模型还有一些更严重的问题:不支持强制的 tool choice,更早的模型读不了它的 thinking block,导致不能中途换模型,改历史消息会让 thinking 失效。输出带有不可见的文本水印(这个之前聊过,非常恶心,会导致生成的文案质量变差)Artificial Analysis 帮 Anthropic 做预发布测评的反馈显示:即使缓存降价 75%,Fable 5.1 Max 跑完任务的实际开销依然比 Fable 5 Max 贵 20%,因为它的输出 token 大约是 Fable 5 的 1.7 倍。看起来还是挺拉胯的,反而更贵了,再加上隐形文本水印以及无法切换模型这些问题。是不是意味着一旦它触发了安全护栏,你切到 Opus 5,缓存就直接失效掉了,随后调用成本跟着大幅上涨?
查看原文链接
89
李飞飞的 World Labs 发布了他们新的世界模型 Atlas…
作者: 歸藏的AI工具箱 | 时间: Wed Sep 02 11:21:31 +0800 2026 | 分类: 新闻
时效性:61.2 | 来源可信度:42.0 | 新意:59.0 | 传播性:60.8 | 信息密度:82.0 | 知识性:92.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 49 / 评论 1 / 点赞 65
原文
李飞飞的 World Labs 发布了他们新的世界模型 Atlas,这个看起来比上一代厉害多了。通过一张图片就可以创建一个非常完整的 3D 空间场景,你可以在里面随意运动,它也能理解时间的演变规律。它能将一张或多张输入图像整合进一个共享的空间上下文中,让每张图像都锚定在三维空间中的具体位置,再以此继续生成后续内容,既能保证当前场景的一致性,又能想象出没有看到的内容。它主要支持三大任务:生成图像和视频:能从一张或多张参考图出发,以像素级精确的相机控制生成不同角度的图像或完整视频,最长可输出 1 分钟 1440p 的视频3D 场景重建:用一张或几十张图片重建真实的 3D 场景,直接生成点云、3D 高斯泼溅(3D Gaussian Splatting)等三维结果(图片越多还原越真实),效果甚至超过了专门针对 3D 高斯泼溅优化的模型时空仿真:能把几台普通手机拍摄的视频重新取景成“子弹时间”效果,还可以为机器人训练生成测试数据过几周才能用 歸藏的AI工具箱的微博视频
查看原文链接
90
这花了几年的时间,但我认为我们终于接近了 LLM 训练的 xgbo…
作者: 斌叔OKmath | 时间: Wed Sep 02 16:07:18 +0800 2026 | 分类: 模型
时效性:69.2 | 来源可信度:42.0 | 新意:63.0 | 传播性:40.3 | 信息密度:93.0 | 知识性:92.0 | 原创信号:86.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、gpt、llm 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 6 / 评论 0 / 点赞 14
原文
这花了几年的时间,但我认为我们终于接近了 LLM 训练的 xgboost 时刻。当 xgboost 问世时,它让在表格数据上训练模型变得如此简单,以至于每家公司突然都能在没有真正研究团队的情况下推出快速且有用的模型。语言模型的优点是我们不再局限于适合电子表格的数据。在接下来的这一年里,预计会看到针对各种用例的任务特定小型语言模型的兴起。引用:Training tiny models for special purpose use cases works so incredibly well if you have a great self improving recursive flywheel. Shopify ML team is on fire.finetuned 0.8b model beats GPT 5.6-sol xhigh in this very specialized task.网页链接
查看原文链接
91
2026年9月3日 周四早评1、昨日A股迎来明显回调,三大指数低开…
作者: 股道-老张 | 时间: Thu Sep 03 08:30:49 +0800 2026 | 分类: 新闻
时效性:96.5 | 来源可信度:42.0 | 新意:59.0 | 传播性:8.0 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 1 / 点赞 15
原文
2026年9月3日 周四早评1、昨日A股迎来明显回调,三大指数低开低走全天走弱。创业板指跌2.39%,科创50同步调整下跌1.82%。两市成交1.79万亿,较前一交易日大幅缩量2400多亿,增量资金选择观望避险。盘面上市场割裂十分明显,全市场仅1541家个股上涨,3901家个股下跌,亏钱效应扩散。国防军工成为全场最强主线,晟楠科技、内蒙一机、建设工业、长城军工批量涨停;前期强势的算力、光模块、AI PCB、有色、农业种业集体杀跌出逃,高位成长板块获利盘集中兑现。隔夜美股三大指数结束连跌迎来反弹,费城半导体指数小幅上涨0.45%,英伟达大涨3.2%,存储芯片同步反弹。美债收益率冲高之后有所回落,10年期美债收益率回落至4.78%附近,缓解高估值成长股的估值压制;国际原油维持高位震荡,避险资产黄金走强。消息催化①交易所L2增强行情新规正式落地:规范Level‑2行情数据使用,严禁光分器、行情镜像绕道抢跑,从源头约束量化灰色套利手段,中长期维护市场交易公平,短期对盘面波动扰动有限。②军工板块情绪爆发:地缘冲突持续升温,霍尔木兹海峡风险持续扰动全球市场,军工产业链资金大举流入,成为昨日市场唯一抱团突围方向,关注后市吧,最近都是轮动行情③ 章建平已退出中际旭创前十大股东名单 二季度末曾位列第九大股东根据公告,章建平二季度持股比例0.53%,是第九大股东;最新第10名都持股0.64%,比章盟主多了200万股,他大概率被“挤”出去十大股东了!④医药:新版国家基本药物目录已经正式实施,国产一类创新药首次纳入目录,创新药、中成药、CXO存在事件驱动的修复机会。⑤ 北交所迎来五周年催化,昨日北证50逆势大涨2.5%,北交所政策红利预期升温。昨日市场放量杀跌之后,成交额快速萎缩,说明资金在恐慌之后不愿意继续杀跌,但是也没有大规模进场抄底。高位科技板块经过连续回调之后,存在超跌修复的需求,但筹码博弈剧烈,不要急于追高,重点观察低开之后承接力度。今日重点观察沪指3920‑3940一带支撑,若支撑守住,市场会进入震荡修复;如果支撑失守,会进一步下探。经过普跌之后,资金会重新做高低切换。股票
查看原文链接
92
技术博文:大语言模型推理的效率前沿地址:www.baseten.c…
作者: 蚁工厂 | 时间: Wed Sep 02 13:29:19 +0800 2026 | 分类: 模型
时效性:64.8 | 来源可信度:42.0 | 新意:69.0 | 传播性:51.2 | 信息密度:89.7 | 知识性:73.8 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、推理、gpu 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 19 / 评论 1 / 点赞 10
原文
技术博文:大语言模型推理的效率前沿地址:www.baseten.co/blog/the-efficient-frontier-of-llm-inference/部署大语言模型时,延迟与吞吐量通常无法同时无限提升:追求单个用户更快的响应,往往会降低 GPU 同时处理请求的能力并推高成本;扩大批量、提高吞吐量,则可能让每个用户等待更久。“效率前沿”就是在既定软硬件条件下,两项指标所能达到的最佳组合边界。推理工程的工作,一部分是在这条边界上选择合适的位置,另一部分则是通过技术优化把整条边界向外推。
查看原文链接
93
真心给国家提个建议,就是逐步减少增值税,改为消费税
作者: 有个梨GPT | 时间: Thu Sep 03 01:59:55 +0800 2026 | 分类: 新闻
时效性:85.6 | 来源可信度:42.0 | 新意:41.0 | 传播性:58.4 | 信息密度:79.0 | 知识性:82.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 39 / 评论 61 / 点赞 92
原文
真心给国家提个建议,就是逐步减少增值税,改为消费税。先把现有增值税中国税部分保留为增值税,再把地税部分改为地方消费税,税率由地方自己定,在一定范围内浮动。第一个好处是减少社保征收。比如象上海这样的地方,如果地税收入高就不必那么高的征社保;而征收社保实际上只有工作人群缴纳,而征消费税是全民的,这样更适合老龄化地区,也适合老龄化趋势,不然年轻人缴费太多了,企业也不堪重负。第二是差异化的社会生活标准,比如象食品卫生水平、交通和环境保护这些问题,都是有成本的。高消费税率可以有更高的标准。这是可以有听证会和监督的,就跟小区物业费一个逻辑,不同地区可以选择不同的标准,量力而行。第三,消费税征收以消费地为准。而不是象增值税一样是生产端征收。这样一家企业在本地和不在本地,虽然影响就业和收入,但减少了因为GDP和税收导向的扶持。比如网上一些新闻里劳动者在和企业的纠纷中总是处于下风,因为企业店大欺客呀,本地劳动局不敢管,因为它是纳税大户。----综上,增值税主体对于大国而言,在从生产型走向消费型过程中,开始是利大于弊的,但慢慢就弊大于利了。很多扯来扯去的看似很难解决,其实税收思路一变就迎刃而解。现代国家的社会公平保证是以法律和税收为基础的。不打打杀杀的经济活动里如何合理分利,也是税收的方式定义的。现存的很多问题都是消费税比例太低造成的。而且在传统观念里,房产税难以征收也是因为没有消费税的习惯。想先于普征消费税大面积合理税率普征房产税也几乎不可能。
转发者评论
原帖不是在说改税法吗?//@唯妮说:税局没有执法权,北京人在PDD上摆摊,北京税局想PDD提供这个北京人的流水,PDD可以根本不鸟北京地税。税局要查本地商户也往往要和公安联合行动。你对税务运作一窃不通,就喜欢胡说八道。//@有个梨GPT: 你说的这个问题90年代是成立的,现在绝大多数销售商品都是出机打
查看原文链接
94
【让 AI 拥有顶级审美:Lieflat Charts 重新定义 …
作者: 爱可可-爱生活 | 时间: Wed Sep 02 09:17:30 +0800 2026 | 分类: 工具产品
时效性:57.8 | 来源可信度:42.0 | 新意:63.0 | 传播性:54.7 | 信息密度:93.0 | 知识性:89.0 | 原创信号:84.0
为什么重要
它关系到工具/产品层面的可用变化;同时涉及 ai、agent、claude 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 27 / 评论 1 / 点赞 33
原文
【让 AI 拥有顶级审美:Lieflat Charts 重新定义 Agent 的数据表达】Lieflat Charts 是一个专门为 AI Agent 设计的数据可视化 Skill(repo:larashero3-dotcom/lieflat-charts)。它不再让 AI 盲目调用绘图库,而是通过一套包含 Lupi(叙事型)、Glance(快读型)等风格的视觉语法,让 AI 能根据数据意图自动生成精致、可交互的 HTML 图表或整页报告。它支持 Claude Code、Codex 等主流工具,通过简单的指令就能把枯燥的 CSV 变成具备编辑质感的视觉作品。这个项目的价值在于它把“阅读速度”引入了可视化逻辑。很多时候我们缺的不是绘图工具,而是懂数据叙事的编辑。它让 AI 明白,论文数据需要留白和旁注来引导深思,而周报数据则需要大数字和色块来辅助决策。这种从数据契约出发而非库模板出发的思路,让 AI 摆脱了廉价的工具感,真正开始承担起专业分析师的角色。它不仅解决了审美平庸的问题,更重要的是为 AI 提供了一套处理信息主次关系的逻辑框架。
查看原文链接
95
【#李诞向何小鹏取创业经#丨《互相关注》EP04正片】如果三四年后…
作者: 新浪资讯台 | 时间: Wed Sep 02 12:20:38 +0800 2026 | 分类: 新闻
时效性:62.9 | 来源可信度:42.0 | 新意:46.0 | 传播性:83.5 | 信息密度:77.3 | 知识性:84.2 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 2 / 账号数 2 / 转发 441 / 评论 131 / 点赞 1491
原文
【#李诞向何小鹏取创业经#丨《互相关注》EP04正片】如果三四年后机器人进入服务业,你敢信吗?面对这个问题,何小鹏没有犹豫。他坚信,当硬件、软件、设计、制造全部掌握在自己手里时,物理AI的拐点就不会太远!从UC到小鹏集团,从人形机器人到飞行汽车,何小鹏坚信趋势决定高度、品德决定走多远。李诞感叹:“他好像不是在画饼,这好像真的是一个可实现的理想。”城市间用低空飞行,城市内用自动驾驶,小区内用人形机器人——这是何小鹏看到的未来。那个永远在挑战自己的创业者,愿意为这些事业付出十年、二十年的热情。新浪新闻独家出品《#互相关注#》第4期 李诞@李诞 x 何小鹏@XP-何小鹏 正片上线!方向对了,就不怕路远。 互相关注的微博视频
转发者评论
#李诞向何小鹏取创业经# 何小鹏亮剑:明年在全球市场和友商正面对决自动驾驶!#互相关注#
查看原文链接
96
【圆通无人快递车失控撞翻菌子摊 网友:无人车吃见手青了
作者: 快科技官方 | 时间: Thu Sep 03 08:53:18 +0800 2026 | 分类: 新闻
时效性:97.1 | 来源可信度:68.0 | 新意:55.0 | 传播性:8.0 | 信息密度:69.6 | 知识性:73.5 | 原创信号:86.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;来源账号权威性较高,可信度相对更强
事件概览
聚类条数 1 / 账号数 1 / 转发 0 / 评论 0 / 点赞 2
原文
【圆通无人快递车失控撞翻菌子摊 网友:无人车吃见手青了?】9月2日,云南怒江兰坪白族普米族自治县沘江路附近,一辆圆通无人驾驶快递车失控冲入路边小巷,撞上菜摊,大量菌子等货品被碾坏。所幸未造成人员伤亡,事故正在处理中。该视频在网上引起网友热议,有网友调侃称:“无人车是不是吃见手青了?产生幻觉把菌子摊认成充电桩了。”、“菌子摊老板:这次来了个打单子,第一次觉得’人工智能’挺好,还会打包买单。”百姓关注的微博视频
查看原文链接
97
戴森的 AI 牙刷 CameraJet,第一次看到还以为是段子,没…
作者: i陆三金 | 时间: Wed Sep 02 16:40:12 +0800 2026 | 分类: 新闻
时效性:70.1 | 来源可信度:42.0 | 新意:59.0 | 传播性:41.7 | 信息密度:85.3 | 知识性:93.6 | 原创信号:94.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 7 / 评论 5 / 点赞 19
原文
戴森的 AI 牙刷 CameraJet,第一次看到还以为是段子,没想到是真的。这个牙刷相当于集成了电动牙刷和冲牙器,并且更智能。售价 499美元。牙刷配备了 10万像素微距镜头的摄像头,每秒扫描 28 张实时图像,能即时识别、追踪并预测齿间缝隙。这个摄像头还可以作为内窥镜,用户可通过戴森 app 的实时观看功能查看细节。当镜头捕捉到缝隙后的 100 毫秒内,设备便能精准检测并喷射漱口水,形成锥形水流,在刷牙的同时实现齿间冲洗。牙刷搭载了 1600 万行代码,并基于研发过程中收集的 47 万张口腔影像训练出的机器学习系统。戴森说,这款牙刷研发历时六年,661 位戴森工程师参与,并申请了 38 项专利。这样一说,怎么感觉还挺值的 i陆三金的微博视频
查看原文链接
98
#A股再调整原因#📉9月2日A股迎来明显震荡回调,收盘沪指跌0.…
作者: 股道-老张 | 时间: Wed Sep 02 18:42:52 +0800 2026 | 分类: 用法技巧
时效性:73.5 | 来源可信度:42.0 | 新意:59.0 | 传播性:34.4 | 信息密度:86.0 | 知识性:96.0 | 原创信号:94.0
为什么重要
它对实际使用方法有直接参考价值;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 5 / 点赞 21
原文
#A股再调整原因#📉9月2日A股迎来明显震荡回调,收盘沪指跌0.97%,深成指跌1.88%,创业板指大跌2.39%。盘面数据很残酷:两市仅1541家上涨,3901家个股下跌,涨跌比严重失衡,54家涨停,8家跌停,亏钱效应大面积扩散。复盘今天调整的几重核心诱因:1、外围风险传导:美债收益率走高,海外科技股集体回调,AI算力、光模块、半导体等成长赛道承接无力,成为杀跌主力,前期涨幅大的高位筹码集中兑现。2、月末过后资金调仓扰动,九月开局,高位成长经过一轮上涨之后,获利盘积累,资金高低切换过程中出现踩踏,低位板块承接还没有完全接力起来,形成阶段性空窗。3、地缘风险升温,避险情绪抬升,资金涌向军工避险,军工板块逆势走强,成为全天为数不多的赚钱主线。但也不用过度悲观:本次更多属于上涨之后的筹码清洗,并非系统性熊市到来。中报已经收官,市场进入业绩真空期,后续依旧依靠政策、产业催化驱动。地产新政、国产替代、算力产业的中长期逻辑没有破坏,只是短期情绪退潮。接下来重点观察两大信号:一是沪指关键支撑位的守住情况;二是杀跌之后,低位板块能否顺利接棒,资金完成平稳切换。震荡市,切忌盲目追高,恐慌杀跌也不宜盲目割肉,控制好仓位等待情绪修复。股票
查看原文链接
99
你身边有没有一个擅长装修的朋友
作者: 飞飞喷浆机 | 时间: Wed Sep 02 19:42:06 +0800 2026 | 分类: 新闻
时效性:75.1 | 来源可信度:42.0 | 新意:41.0 | 传播性:68.0 | 信息密度:79.0 | 知识性:85.0 | 原创信号:68.0
为什么重要
它更像一条新闻信号;仍在 24 小时窗口内,适合快速跟进
事件概览
聚类条数 1 / 账号数 1 / 转发 99 / 评论 137 / 点赞 828
原文
你身边有没有一个擅长装修的朋友。当我说出这个关键词的时候,你们一定知道这是李杰灵,是的,确实是他。我永远都忘记不了,2018年的那个夏天,杰灵跟我说,肉呆啊,我一定要带你看看我新装修的别墅,里面有钢铁侠。我说好啊,在哪儿啊。杰灵掏出手机,开始不断缩放地图的时候,我就有点慌了,再缩,那可就是东南亚了,他指着一个绿油油的地方说,喏就在这儿,很近的,开车一个半小时就到了,你来参观一下,里面有钢铁侠。我说这不是一个山区么?他说不是,这是一个别墅区,在半山腰,风景很好,他家装的也很好,关键是,里面有钢铁侠。我说你总强调你家有钢铁侠,就跟说你家猫会翻跟斗一样,你再说下去,就不是带我参观了,是带我上床。他说不是,装的真的很好,他还在墙上装了一张床,床对面就是钢铁侠。听到这里的时候,我的疑惑已经开始溢出了,墙上的床和钢铁侠,就如同深渊一样凝视着我,像未解之谜一样吸引着我。两个小时后,我问杰灵,杰灵,还没到么?杰灵说快了,你看见前面那座山了么?我说看到了。杰灵说,那是香港。我说你家在香港?杰灵说,不是,是我走错了。杰灵的小区门很有风味,换话说,是很有风景区的味道,这是一个无人值守的,通往山区的一道门,杰灵摁了摁喇叭,十分钟后,他掏出电话说,我到山下了,麻烦开下门,我带我朋友看我家的钢铁侠。我隐约听见电话那头说,我在门口啊。杰灵看了看周围说,没有人啊,只有大门。电话那头说,我在大门口啊,门口没有车。杰灵说奇怪,难道是我又走错了?十分钟后,弄明白导航的杰灵说,是导航的问题,这是山的这一边,我们要从山的那一边上去,这一边,是去香港的。当我终于到他家,下车之后,映入眼前的,是勃勃生机、万物竞发的境界,什么小蛇啊、松鼠啊、黄鼠狼啊、硕大到令我恐惧的昆虫啊、猫啊、狗啊,哎,杰灵那是什么,黑黑的一坨?肉呆不要看别的地方,盯着他慢慢走!慢慢走!千万别挪开你的视线!这是野猪,你突然看别的地方它会追你的!快跑,快往我家跑!我家里有钢铁侠!说实话,我现在已经有点相信他圈养了托尼斯塔克在他家。进屋之后,杰灵就向我展示了他们家顶级的智能家居,拍拍手,一片漆黑的家里果然还是一片漆黑。杰灵告诉我,拍拍手,其实不是控制灯,而是让地下室的、他花钱最多的、最花心思、请了香港调音师专门来调画面和声音的小影院把设备打开,小氛围整起来。那开灯呢?杰灵仿佛天才降临一般的看着我说,我只要说卧室,卧室的灯就……你看,灯开了吧,我说客厅,你看,客厅……哎,卫生间的灯怎么……哎,客厅……哎卫生间又灭……哎客厅,不重要!我带你去看看我的小影院。那钢铁侠呢?在楼上走廊……哎,阳台灯怎……哎次卧也亮……哎厨房……哎……好了我们可以去了么?杰灵很开心的打开蓝光播放器,上面写着明晃晃的几个大字,oddo,我说杰灵,你这个是什么牌子?山寨么?杰灵说,不是,是机器放反了,这是OPPO的。来,我们看蜘蛛侠。蜘蛛侠在硕大的幕布右侧说的话从房间…
转发者评论
一会捏一个?[doge]//@巍峰:我猜今晚就会有人做个 AI 短剧出来🌚//@李杰灵:对,没什么好解释的,那栋山里的房子前年已经卖了,亏了600万。//@蜗牛听雨:都卖了[doge]//@Mr-Wang的碎碎念:@李杰灵 翻车天才快过来解释
查看原文链接
100
MiniMax H3 Max 现在生成 15 秒视频只要约 9秒,…
作者: 刘彬 | 时间: Wed Sep 02 15:33:57 +0800 2026 | 分类: 模型
时效性:68.2 | 来源可信度:42.0 | 新意:45.0 | 传播性:75.3 | 信息密度:77.6 | 知识性:82.8 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;转发量较高,说明传播速度和讨论热度都不低
事件概览
聚类条数 1 / 账号数 1 / 转发 201 / 评论 10 / 点赞 135
原文
MiniMax H3 Max 现在生成 15 秒视频只要约 9秒,已经比你看视频还快!fal把它接进 Twitch,做了一个永远播不完的 AI 直播:你在前面看,AI 在后面实时生成下一段。直播、互动剧、无限世界,不需要提前准备内容了。在 fal 上运行这个 24/7 直播每天花费约 3,450 美元。在 Seedance 上运行完全相同的连续直播每天将花费超过 40,000 美元。成本低 10 倍,5 秒渲染在不到 3 秒内完成。
转发者评论
//@张戴阳Tillo:太牛逼了 而且 MiniMax 的效果真的和 Seedance 不相上下,认识的不少人都已经换模型了//@乌龟吃鱉3rds:草//@白茶_一生悬命魔芙厨:草电表倒转了//@石灰水Leo:啊。。这下真的有点离谱了//@123木头人被占用了:……//@金山://@来去之间://@八大山债人:nb了。乛乛
查看原文链接