性爱贴图大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

栏目分类

热点资讯

橘梨纱作品

你的位置：丝袜控 > 橘梨纱作品 >

性爱贴图大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

发布日期：2024-09-28 06:49 点击次数：167

性爱贴图大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

继分不清 9.11 和 9.9 哪个大以后性爱贴图，大模子又“集体失智”了！数不合单词“Strawberry”中有几个“r”，再次引起一派参谋。

GPT-4o 不仅错了还很自信。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

刚出炉的 Llama-3.1 405B，倒是能在考据中发现问题并改正。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

相比离谱的是 Claude 3.5 Sonnet，还越改越错了。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

提及来这并不是最新发现的问题，仅仅最近新模子接连发布，尽头吵杂。

一个个堪称我方数学涨若干分，人人就再次拿出这个问题来测验，成果相称失望。

在繁多有关参谋的帖子中，还翻出一条马斯克对此悠闲的褒贬：

好吧，也许 AGI 比我设想的还要更远。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

路遇失智 AI，拼尽全力终于训诲

有东说念主发现，即使使用 Few-Shot CoT，也等于“一步一局势想”大法附加一个东说念主类操作示例，ChatGPT 也曾学不会：

倒是把 r 出现的位置都标成 1，其他标成 0，问题的难度下跌了，可是数“1”依旧不擅长。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

为了训诲大模子数 r，全球网友脑洞打开，成立出各式奇奇怪怪的领导词妙技。

比如让 ChatGPT 使用漫画《圆寂条记中》高才能变装“L”可能使用的程序。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

ChatGPT 想出的程序倒是也很朴素，等于分手把每个字母写出来再一个一个数并纪录位置，总之终于答对了。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

有 Claude 玩家写了整整 3682 个 token 的领导词，程序来自 DeepMind 的 Self-Discover 论文，不错说是连夜把论文给复现了。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

系数这个词程序分为两大阶段：先针对特定任务让 AI 自我发现推理圭臬，第二阶段再具体施行。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

发现推理圭臬的程序浅薄详尽等于，不光要会抽象的想维程序，也要具体问题具体分析。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

这套程序下，Claude 给出的谜底也尽头复杂。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清性爱贴图，最新最强 Llama3.1 也傻了

作家补充，花这样即兴气解决“数 r 问题”其实并不信得过实用，仅仅在尝试复现论文程序时未必测试到了，但愿能找出一个能用来恢复系数问题的通用领导词。

不外很可惜，这位网友当今还没公布无缺的领导词。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

还有东说念主猜度更深一层，若是要缱绻文档中 straberry 出现若干次何如办？

他的程序是让 AI 设想有一个从 0 运转的内存计数器，每次遭受这个单词就往上加。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

有东说念主褒贬这种程序就像在用英语编程。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

也有 AI 不错一次作念对

那么究竟有莫得大模子，不错不靠特等领导词径直答对呢？

其实不久之前有网友叙述，ChatGPT 是有小概率能径直答对的，只不外不常见。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

谷歌 Gemini 好像有三分之二的概率能答对，打开“草稿”就能发现，默许每个问题恢复三次，两次对一次错。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

至于国内选手，在发问状况协调、每个模子只给一次尝试契机的测试下，前次能正确判断数字大小的，此次一样踏实判辨。

字节豆包给出了正确恢复，还猜想用户问这个问题是要学习单词拼写吗？

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

智谱清言的 ChatGLM，自动触发了代码模式，径直给出正确谜底“3”。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

腾讯元宝像解数学题一样列方程给出了正确谜底（天然貌似莫得必要）。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

文心一言 4.0 收费版则愈加详备，亦然先正确连结了意图，然后掰指头挨个找出了一皆的“r”。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

不外特真义的是，在吞并种程序下，文心一言 App 中的免费版文心 3.5 掰指头也能数错。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

雨宫琴音番号

讯飞星火也通过找出“r”地方位置给出了正确恢复。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

如故 token 的锅

天然“数 r”和“9.11 与 9.9 哪个大”，看似一个是数字问题一个是字母问题，但关于大模子来说，都是 token 问题。

单个字符对大模子来说意旨有限，使用 GPT 系列的 Llama 系列的 tokenizer 就会发现，20 个字符的问题，在不同 AI 眼中是 10-13 个 token。

其中洽商之处在于，strawberry 被拆成了 st-，raw，-berry 三个部分来连结。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

换一个想路用格外字符ⓢⓣⓡⓐⓦⓑⓔⓡⓡⓨ来发问，每一个字符对应的 token 也就会分开了。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

靠近这种问题，其实最浅薄的程序等于像智谱清言一样，调用代码来解决了。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

不错看到，ChatGPT 径直用 Python 言语字符串的 count 函数，就能浅薄科罚。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

刚刚创业开了所学校的大神卡帕西以为，关节在于需要让 AI 知说念我方能力的鸿沟，才能主动去调用器用。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

至于教给大模子判断我方知说念不知说念的程序，Meta 在 LLama 3.1 论文中也有所波及。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

临了正如网友所说，但愿 OpenAI 等大模子公司，都能不才个版块中解决这个问题。

大模子智障检测 + 1：Strawberry 有几个 r 纷纷数不清，最新最强 Llama3.1 也傻了

GPT Tokenizer 试玩：

https://gpt-tokenizer.dev

Llama Tokenizer 试玩：

https://belladoreai.github.io/llama-tokenizer-js/example-demo/build/

参考连结：

[1]https://x.com/diegoasua/status/1816146114573394143

[2]https://www.reddit.com/r/ClaudeAI/comments/1eap6b1/comment/leolf3t/

[3]https://www.reddit.com/r/ChatGPT/comments/1do7cnq/counting_the_rs_a_chat_with_chatgpt/

[4]https://www.reddit.com/r/ChatGPT/comments/1dpfj2c/a_prompt_where_chatgpt_gets_the_strawberry/

本文来自微信公众号：量子位（ID：QbitAI），作家：梦晨一水

告白声明：文内含有的对外跳转连结（包括不限于超连结、二维码、口令等形势），用于传递更多信息，纯粹甄选时辰性爱贴图，成果仅供参考，IT之家系数著述均包含本声明。

上一篇：人妻究竟如何交融尼采的话“天主死了”？

下一篇：toupai 当今的秋月梨真可口！清甜脆爽，汁水超等多！每年中秋都要买两箱|培育|果树

友情链接：

Powered by 丝袜控 @2013-2022 RSS地图 HTML地图

Copyright Powered by站群 © 2013-2024 版权所有