1
我最近一直思考一个问题:普通人如何用好大模型,现在很多人的用法可能…
作者: agentzh | 时间: Mon Apr 27 06:04:26 +0800 2026 | 分类: 模型
时效性:91.5 | 来源可信度:42.0 | 新意:66.0 | 传播性:85.9 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;已有 4 个账号围绕同一事件讨论,说明传播面已形成;转发量较高,说明传播速度和讨论热度都不低;同时涉及…
事件概览
聚类条数 5 / 账号数 4 / 转发 555 / 评论 68 / 点赞 726
原文
我最近一直思考一个问题:普通人如何用好大模型,现在很多人的用法可能用反了。。MIT Media Lab今年一项脑电实验发现,习惯让ChatGPT代写的人,大脑额叶和颞顶叶区域活动显著下降——这两个区域恰恰管注意力、工作记忆和语言处理。研究者给这个现象起了个名字,叫"认知债务":你以为省了时间,其实是在透支大脑。更残酷的是,当这些人被要求脱离AI独立写作时,脑神经连接度明显弱于从未用过AI的对照组。短期效率换来的,是长期认知能力的萎缩。微软和卡内基梅隆大学对319名知识工作者的调查印证了同样的逻辑:对AI越有信心,批判性思维投入越少;反而是对自己能力有信心的人,面对AI输出时思考得更深。那大模型就不该用了?不是。关键在于用法。2026年一篇发表在ScienceDirect上的论文提出了一个框架,核心就两条:第一,保留认知摩擦——别让AI把思考过程抹平了;第二,把大模型定位为"临时思考伙伴"而非答案来源。别上来就问AI要答案,而是先自己想清楚一个判断,然后让AI来挑毛病、找漏洞、提反驳。你不是在向它求教,你是在跟它辩论。这个肯定不是我首先发现的,于是我就找论文。其实早在2024年,Khan等人2024年的研究表明,与有挑战性的反驳论点互动,能产生更准确的判断和更深的理解。微软2026年的后续实验也发现,在接受AI输出之前被要求先做结构化反思的人,推理质量远超直接采纳AI结果的人。所以普通人用大模型的正确姿势,不是"有问题找AI",而是"有答案找AI吵架"。前者让你越来越懒,后者让你越来越锐利。AI是磨刀石,不是拐杖。这是非常非常关键的。下面是相关论文:论文链接见评论区。1. MIT脑电实验("认知债务")Kosmyna et al. (2025), Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task2. 微软×卡内基梅隆(319名知识工作者调查)Lee et al. (2025), The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers — CHI 20253. ScienceDirect论文("认知摩擦"+"临时思考伙伴"框架)Scaffolding Critical Thinking with Generative AI: Design Principles for Integrating Large Language Models in Higher Ed…
转发者评论
回复@闲度春秋老燕子:所以自己不如 AI 的地方也需要多学习(包括向 AI 学习),补上自己的短板……//@闲度春秋老燕子:AI知识面太广,跟不上AI的节奏//@agentzh:确实如此。所以我一直说“尽信 AI 不如无 AI" [嘻嘻]
查看原文链接
2
马里兰大学、新加坡国立大学和俄亥俄州立大学联合做了一个实验,他们拿…
作者: 高飞 | 时间: Mon Apr 27 07:31:48 +0800 2026 | 分类: 模型
时效性:93.9 | 来源可信度:42.0 | 新意:60.0 | 传播性:74.7 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;转发量较高,说明传播速度和讨论热度都不低;同时涉及 模型、ai、gpt 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 190 / 评论 14 / 点赞 289
原文
马里兰大学、新加坡国立大学和俄亥俄州立大学联合做了一个实验,他们拿了2245份ChatGPT出现前的真实人类简历,让GPT-4o等7个主流AI模型全部重写一遍,然后让AI自己来挑“哪个简历更好”。这个实验得出4个结论:1. AI招聘工具几乎每次都挑AI写的简历,人类写的几乎没赢过。2. 就算人类评委说人类写的更清楚、更好,AI还是挑自己的。3. AI不但喜欢AI写的,还只认“自己”写的风格。GPT-4o最爱GPT-4o写的,DeepSeek最爱DeepSeek写的,别的AI写的它也看不上。4. 如果你用的AI跟公司招聘工具一样,被挑中的机会会高23%到60%。这个结果非常令人细思极恐。这说明在AI时代到来,你个人的才能没那么重要。自己别觉得自己写作能力强,写简历一定要用AI。而且目前看就要用ChatGPT来写,因为这些大公司招人很多都用ChatGPT来筛选简历。
查看原文链接
3
#模型时代# 行动啊Agent项目越来越多了
作者: 高飞 | 时间: Mon Apr 27 07:16:07 +0800 2026 | 分类: 工具产品
时效性:93.5 | 来源可信度:42.0 | 新意:79.0 | 传播性:56.4 | 信息密度:100.0 | 知识性:91.0 | 原创信号:84.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;已有 3 个账号围绕同一事件讨论,说明传播面已形成;同时涉及 模型、mcp、agent 等关键词,信…
事件概览
聚类条数 3 / 账号数 3 / 转发 32 / 评论 4 / 点赞 37
原文
#模型时代# 行动啊Agent项目越来越多了。刷到一个Cua Driver。Cua Driver 的特别之处在于:它实现了真正后台静默操作,agent 能在 macOS 上驱动任何 app(浏览器、编辑器、Messages 等),完全不抢用户光标、窗口焦点或切换 Space,用户可继续前台工作,而 agent 悄无声息地修复 bug、录演示或回复消息。最大亮点是内置 true multi-player + multi-cursor,支持多个 agent 同时协作、各自独立光标互不干扰;底层还突破性使用 SkyLight 私有 API,能控制 Chromium/Figma 等传统 Accessibility API 无法触达的 canvas 应用。完全开源(MIT)、agent-agnostic,任何支持 MCP 的 agent(如 Claude Code、Codex)都能直接用,还附带 vision/AX/SOM 捕获和 trajectory 重放。官方说是目前 macOS 上最丝滑的开源后台 computer-use 方案。类似项目对比:OpenAI Codex Computer Use(闭源,仅限自家 agent);Anthropic Claude Computer Use(沙箱 VM,不直接控宿主机);agent-desktop(Rust 开源,跨平台、无截图依赖,但无原生 multi-cursor);Simular Agent S2 / Fazm(视觉 GUI 代理,静默度稍弱);Open Interpreter(偏命令行)。想最强 macOS 多 agent 后台体验,直接选 Cua Driver(github.com/trycua/cua)。
查看原文链接
4
美国是“All in AI”,中国是“AI in all”美国的战…
作者: 机工战略 | 时间: Mon Apr 27 09:20:03 +0800 2026 | 分类: 工具产品
时效性:96.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:56.1 | 信息密度:100.0 | 知识性:97.0 | 原创信号:88.0
为什么重要
它关系到工具/产品层面的可用变化;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 31 / 评论 9 / 点赞 59
原文
美国是“All in AI”,中国是“AI in all”美国的战略,是把AI当作下一轮全球科技霸权的主战场,集中力量争夺大模型、芯片、算力、云平台和国际规则。中国的战略,则是把AI作为新型工业化和产业升级的通用工具,推动它进入制造、汽车、能源、医疗、政务和消费场景。一个更像“集中造AI基础设施”,一个更像“把AI嵌入全部产业体系”。这种差异,来自两个国家不同的发展基础和战略惯性。美国的优势在源头创新。它长期掌握全球最强的大学、资本市场、基础软件、芯片设计、云计算平台和科技巨头体系。AI对美国来说,首先是一个“前沿技术制高点”。谁掌握最强模型、最强算力、最强芯片和最强平台,谁就可能定义下一代数字世界的规则。所以美国天然会把AI理解为一场技术主导权之争,一场基础设施之争,也是一场国际规则和安全体系之争。中国的优势在产业体系。中国拥有全球最完整的制造业门类、最大规模的工程师群体、丰富的应用场景和高密度供应链网络。AI对中国来说,不只是一个实验室里的模型,也不是单纯的互联网产品,而是可以嵌入工厂、汽车、机器人、电网、物流、医疗和城市治理的“产业工具”。所以中国更容易把AI理解为一种改造现实经济的通用能力,一种推动新型工业化、产业升级和组织效率提升的工具。美国是“All in AI”。白宫2025年发布《America’s AI Action Plan》,三大支柱是加速创新、建设AI基础设施、主导国际外交与安全,目标很清楚:赢得AI竞赛。美国的打法,是先控制底层能力。芯片、算力、云平台、大模型、数据中心,是它的战略高地。OpenAI、Oracle、软银推进“Stargate”项目,计划投资5000亿美元建设AI基础设施,本质上就是新一轮“AI版曼哈顿工程”。中国是“AI in all”。中国更强调“人工智能+”。国务院2025年印发《关于深入实施“人工智能+”行动的意见》,提出推动AI与科技、产业、消费、民生、治理和全球合作深度融合,并强调模型、数据、算力、开源生态、人才和安全等支撑能力。也就是说,中国不是只追求“造最强模型”,而是要把AI嵌入千行百业,形成“以应用促创新”的循环。汽车是典型案例。中国车企正在把AI嵌入电动车、智能座舱、辅助驾驶、语音交互、智能制造和供应链体系。小鹏、小米、蔚来、比亚迪、华为、地平线等企业,不只是把AI当软件功能,而是把AI变成产品竞争力、制造能力和组织能力。制造业也是典型案例。美国的AI热点,更多集中在数据中心、GPU集群、基础模型和云平台。中国的AI热点,则更快落到工厂现场。工业机器人、机器视觉、智能排产、预测维护、质量检测、数字孪生、具身智能,正在进入汽车、电子、家电、锂电、光伏和装备制造场景。所以,这是一场不同路径的竞争。美国强在“AI基础设施国家化”,中国强在“AI应用场景规模化”。美国要占领AI的源头,中国要让AI进入产…
查看原文链接
5
vibe coding 完项目后,跑这个 Prompt 做安全审计
作者: 黄建同学 | 时间: Mon Apr 27 07:20:00 +0800 2026 | 分类: 新闻
时效性:93.6 | 来源可信度:42.0 | 新意:68.0 | 传播性:63.7 | 信息密度:93.0 | 知识性:98.0 | 原创信号:94.0
为什么重要
它更像一条新闻信号;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、claude、prompt 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 65 / 评论 3 / 点赞 81
原文
vibe coding 完项目后,跑这个 Prompt 做安全审计。最近 AI 生成的代码安全漏洞频出——API key 硬编码在代码里、SQL 注入没处理、认证逻辑靠 AI 随手写的……很多人 vibe coding 完直接上线,根本没做安全检查。网友milesdeutscher分享了一个 Claude Code 专用的代码库深度安全审计 Prompt,值得收藏!Conduct a thorough security audit of this codebase. Check for:1. Exposed API keys, secrets, or credentials hardcoded anywhere2. SQL injection vulnerabilities3. Authentication and authorization flaws4. Insecure direct object references5. Missing input validation or sanitization6. Sensitive data exposure in logs or error messages7. Insecure dependencies or outdated packages8. CORS misconfigurations9. XSS vulnerabilities10. Any critical security issues that could lead to data breachesFor each issue found, explain: what it is, where it is, why it's dangerous, and how to fix it. Prioritize by severity.跑完之后 Claude 会逐条给你列出问题、说明风险等级、给出修复方法。几个值得注意的地方:1. API key 泄露是最常见问题。 vibe coding 时 AI 经常把 key 直接写进代码,或者写进被 commit 的配置文件。很多人根本没意识到这件事。2. 认证逻辑最容易出错。 "帮我加一个登录功能"——AI 给出的实现不一定符合你实际的安全要求,要单独 review。3. 这不是一次就够的。 每次加了新功能后都应该跑一遍,而不是发布前跑一次交差。vibe coding 本身没问题,但安全审计这步不能跳过。#HOW I AI# #程序员#
查看原文链接
6
生成AI图像经常需要反复调提示词,风格飘忽不定、结构失控、细节难以…
作者: 爱可可-爱生活 | 时间: Mon Apr 27 08:47:40 +0800 2026 | 分类: 用法技巧
时效性:96.0 | 来源可信度:42.0 | 新意:69.0 | 传播性:48.2 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它对实际使用方法有直接参考价值;发布时间很近,属于今天仍在发酵的新动态;同时涉及 ai、提示词、gpt 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 14 / 评论 6 / 点赞 31
原文
生成AI图像经常需要反复调提示词,风格飘忽不定、结构失控、细节难以复现,试错成本极高。awesome-gpt-image-2 把海量优秀案例逆向成工业级提示词引擎与模板库,提供了Prompt as Code的完整解决方案。不仅有329个真实案例逆向工程和13套工业级模板,还覆盖UI设计、信息图、海报、电商、摄影等18大场景,支持Agent自动化批量生成。GitHub:github.com/freestylefly/awesome-gpt-image-2主要功能:- 329个案例逆向:从YouMind/OpenNana等社区精选,拆解成原子化Schema(主体/光影/材质/排版);- 13套工业级模板:UI界面、信息图、海报、摄影等,结构化协议防坑指南;- 分类画廊浏览:68个UI案例、59个海报、49个图表等,按册查看完整示例;- 工作流友好:JSON模板支持脚本调用,批量出图、系列化设计一键适配;- 多场景覆盖:商品电商、品牌标志、建筑摄影、插画艺术、古风叙事等;- 快速上手指南:任务类型→结构约束→风格材质,零基础上手Agent集成。支持Web直接浏览,MIT开源免费,适合设计师、开发者、营销团队和AI Agent构建。#AI提示词# #GPT图像生成# #Prompt工程#
查看原文链接
7
#DeepSeek致谢近300研发者10人已离职#首次从技术原理上…
作者: 时蝇喜箭 | 时间: Mon Apr 27 07:37:38 +0800 2026 | 分类: 模型
时效性:94.1 | 来源可信度:42.0 | 新意:55.0 | 传播性:65.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:68.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、算力、推理 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 77 / 评论 47 / 点赞 314
原文
#DeepSeek致谢近300研发者10人已离职#首次从技术原理上看到了中国大模型性能超过美国的希望1. 我说的不是DeepSeek V4。它本身的Agent性能,发布时就如实报告了,还不如Claude Opus 4.6思考模式。新闻关注度很高,我去学习了技术原理。非常振奋,首次看到了中国大模型性能超过美国的希望。不是口号式的“一定胜利”,而是基于技术指数发展的短期可能性评估。2. 需要一些业界常识。现在Claude Opus 4.6成了中国大模型研发的头号目标,没有之一。是Anthropic在2026年2月5日发的,主打复杂推理、编码与Agent能力。现在评分参考意义不足,要看实际任务的口碑。目前中国大模型实用还不如,是最大的短期追赶目标,没有之一。好消息是差距只有2-3个月,是几年来中国大模型与美国时间差距最小的一次。3. 2022年末ChatGPT出来,中国落后约一年。2023年中国公司都在突破一个技术障碍:预训练(pre-train)。OpenAI选择闭源,没有公布技术细节。Meta的Llama开源起了很大作用,2023年2月Llama 1(7B–65B)、7月发布的 Llama 2(7B–70B),首次以可复现的工业级标准,展示了数据配比、架构微调、训练效率、Scaling law验证等技术细节。个人认为,这是对中国自主研发最重要的一次“第一推动”,特别是7月这次,许多中国团队仔细琢磨这些细节,建立研发流程,跑通原型,后面都在努力范围之内了。当时比较突出的是Qwen,在开源路线上不断优化训练数据、扩大参数数量、多模态。4. 2023年起中国公司就算力不足,十分重视优化提升效率,被逼走最底层优化的路线。Llama开源的是Dense架构,所有参数都激活计算,扩大规模吃算力,必须大改。DeepSeek注重从底层去修改模型架构、数据结构、CUDA调用、存储。Kimi主打长文本路线,也有底层能力。这需要积累,2023-2024年没有太大影响,直到2024年末DeepSeek V3才在技术圈引发一些赞赏。最关键技术是MoE(Mixture of Experts,混合专家模型),总参数几千亿,一次激活几百亿规模的专家参数,算力压力大降。还有非常巧妙的MLA(Multi-head Latent Attention,多头潜在注意力机制)。这类精细架构创新,中国公司比美国公司强,做不好就没戏。美国公司有思想,但不会有压力去精细结构创新、跑通,算力不够可以买,不是非得做好。5. 2024年,OpenAI继续引领业界风气,焦点转向了“后训练”(post-train),在pre-train的基础上,通过RL(强化学习)增强能力,思维链极大增加推理能力。这条路线,DeepSeek R1在2025年初震惊世界,而且将所有技术细节开源,极大促进了开源社区的实力。从此,许多中国公…
转发者评论
请 @Transformer-周 评论一下
查看原文链接
8
前几天 Claude Desktop 和 Claude Cowor…
作者: tombkeeper | 时间: Sun Apr 26 23:18:46 +0800 2026 | 分类: 模型
时效性:80.2 | 来源可信度:42.0 | 新意:74.0 | 传播性:66.8 | 信息密度:100.0 | 知识性:88.0 | 原创信号:82.0
为什么重要
它直接关系到模型能力或版本进展;仍在 24 小时窗口内,适合快速跟进;同时涉及 模型、大模型、claude 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 88 / 评论 17 / 点赞 385
原文
前几天 Claude Desktop 和 Claude Cowork 悄悄新增了一个功能:原生支持使用任何大模型 API。具体入口是:Developer -> Configure Third-Party Inference。对于 Claude Desktop 来说要先开启 Developer Mode:Help -> Troubleshooting -> Enable Developer Mode。考虑到 Anthropic 这家公司一贯的做事风格,这个举动显然很值得玩味——也许他们终于想明白了:大模型因为切换成本不高,所以用户忠诚度很低,都是谁强用谁,谁便宜用谁。大模型领域的霸主就像猴王一样,合法性完全基于武力值,只要不再是最强的那个,就会立即被赶下台,没有一只母猴会留恋它。但工具产品的用户粘性则比模型要高得多。
查看原文链接
9
DeepSeek自己承认落后GPT-5.4三到六个月,这句话听着像…
作者: 爱可可-爱生活 | 时间: Mon Apr 27 08:44:02 +0800 2026 | 分类: 模型
时效性:95.9 | 来源可信度:42.0 | 新意:74.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:98.7 | 原创信号:92.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 推理、ai、gpt 等关键词,信息密度较高
事件概览
聚类条数 2 / 账号数 2 / 转发 3 / 评论 1 / 点赞 15
原文
DeepSeek自己承认落后GPT-5.4三到六个月,这句话听着像示弱,其实是最狠的一刀。你想想,谁最需要最顶尖的推理能力?科研机构,极少数头部企业,加起来可能占市场的5%。剩下那95%呢?企业客服、文档摘要、内容生成、数据清洗,这些场景要的不是天花板有多高,是地板价有多低。DeepSeek说我覆盖80%的中低复杂度场景,翻译一下就是:绝大多数付费用户根本用不到GPT-5.5那个级别的能力,但他们一直在为那个级别的成本买单。这才是真正扎心的地方。OpenAI花了几十亿美金堆出来的前沿能力,在商业变现层面,被一句“够用就行”给化解了。技术领先当然重要,但技术领先的商业护城河,可能比大家以为的要浅得多。 #DeepSeek推动AI价格战# deepseek推动ai价格战
查看原文链接
10
1946年至今,「人类最高智商俱乐部」门萨将迎来第一位非人类成员
作者: 新智元 | 时间: Mon Apr 27 09:19:45 +0800 2026 | 分类: 模型
时效性:96.9 | 来源可信度:42.0 | 新意:69.0 | 传播性:34.4 | 信息密度:100.0 | 知识性:100.0 | 原创信号:94.0
为什么重要
它直接关系到模型能力或版本进展;发布时间很近,属于今天仍在发酵的新动态;同时涉及 模型、推理、ai 等关键词,信息密度较高
事件概览
聚类条数 1 / 账号数 1 / 转发 3 / 评论 2 / 点赞 4
原文
1946年至今,「人类最高智商俱乐部」门萨将迎来第一位非人类成员。GPT-5.5 Pro在线文本智商133、视觉智商145、线下测试得分130,这是AI第一次正式跨过门萨会员线,而145对应的是门萨官网「前0.1%」的天才区。更炸的是文本与视觉15分的差距——这不是测试误差,是模型在「看图找规律」上的能力,比「读题做推理」高出了整整一个标准差。过去十二个月,所有顶级模型在视觉题上集体哑火,Claude 4.7、GPT-5.4 Pro全部卡在125以下,GPT-5.5 Pro的145,是真正意义上的墙倒了。这堵墙是怎么砸碎的?门萨Norway采用3×3九宫格格式,完全非语言、非文化依赖,考察抽象推理。以前LLM做这种题,先把图片转成token再推理,丢的恰恰是空间结构和拓扑关系——也就是最核心的信息。GPT-5.5 Pro的145,说明这套底层逻辑已经被重写了。与此同时,GPT-5.5的Token使用减少45.6%,智能分数却提升了1.77倍。SemiAnalysis的评测结论是:数学上GPT-5.5最强;编程上与Opus 4.7互有胜负;智能体任务上,Claude和GPT-5.5双双甩开其他所有模型。当你的产品比对手聪明一倍、延迟只有一半,市场规则就失效了,剩下的只有收割。OpenAI的节奏是「每月一炸」。你昨晚刚调优好的工作流,今天可能已经被原生能力直接覆盖,Prompt工程正在变成一次性用品。去年视觉天花板还停在119,今年直接跳到145,没有过渡,没有预告,只有一行更新日志。技能的半衰期正在被按月缩短——那个「诚恳的小火车头」不打算等任何人。
查看原文链接