P&KU(Puzzle and Key Universe)是由北京大学学生谜题协会(Peking University Puzzle Club)出品的、以网页解谜为主的系列解谜企划。自 2021 年首次举办以来,至今已进行了 4 届:P&KU0、P&KU1、P&KU2 和 P&KU3(上)。
活动时间:北京时间 2026 年 7 月 17 日 20:00 - 2026 年 8 月 2 日 20:00。
序章
首先需要声明的是,本次比赛依旧由我加上另一名队友两人完成,不过不同的是,这次我们还有不知道多少位的 AI 队友。比赛中我们所使用的 LLM 基本上是 GPT-5.6-Sol Max,前期我使用了 Ultra 然后发现其表现不佳,子代理问题很大。我们使用的 harness 均是 Codex Cli 和桌面端,不过现在应该改名叫做 ChatGPT 了。另外,有部分题目使用了 Gemini 3.6 Flash 和 Gemini 3.1 Pro 模型进行对话模式下的求解,当然只是极少数的简单题目才能这么做。
本次比赛的剧情延续了之前的,只放出了第四日的内容,核心是因果。其整个结构由六个区域组成,并且通关第一结局后会让三个区域的因果链条发生变动,修改一些题目,之后再完成最终 Meta 的二次求解。我会在下面记录由主要有我参与解答的一些题目的过程和思路,至于 LLM 相关的话题会放在最后面。
蛹
参宿一
其实我被这题卡了(笑),我实在不敢相信这题的图上的意思是 101 - 21,所以一开始没敢直接交答案(因为那时候网页很卡,服务端还加了全局提交冷却)。我把这题面扔给了 Gemini,它也给出了 80,行吧,看起来也没有别的合理的解释了,结果居然是对的(
参宿二
一眼看出是 up 和 down 的意思,然后人肉提取得到 POP-UP,居然还必须要加上这个杠。
参宿三
直接偷懒交给 Gemini 告诉我是体温计,然后它不知道交什么写了英文翻译,我交了个 温,对了。
Meta: 腰带
本题是我在队友的想法提示下完成的,AI 屁用没有,把上面三道题的三张图按顺序摆起来,发现是一道新题目,人工做一下就好得到 I。
图寻 - 文
我看出第一个是“三百六十行”,队友看出第二个是“道生一”,在有前两个当提示的情况下剩下来的交给 GPT 即可,加上一点点猜测得到 youngs。
图寻 - 色
GPT 能看出来几个,不过第一个和第三个是错的,得靠 qat 暴力一下得到 orange。
图寻 - 地
GPT 看对了三个,我看出了皇室战争的地图,然后 qat 暴力得到 lawson。说得这么简单,其实如何排除它的错误答案其实让我们头疼了好久。
图寻 - 形
GPT 只看出了 4 和 6,队友看出了 3 是跳房子、1 是军棋,然后暴力得到 unworn,排错确实还是难事。
图寻 - 角
Gemini 除了最后两个其它全都看出来了,我当然认得最后那个是 P&KU 的标志性 404 提示,于是得到 colors。
信息可视化
这题 GPT 基本把每个框里是什么字母全都对应上了,但是它不知道中间那是什么玩意,然后我接管了,看了半天,也没看出是什么玩意……队友通过别的题目发现这些题的答案是四元素,于是猜出了是 水。
Meta: 拼块
队友做了半天疯狂地说“无源磁场”,我上来一看这不 二次能源 吗……
Meta: 移动
非常抓耳挠腮的一题,无论是 GPT 还是 Gemini 都能做出来 SCALDING SHAMPOO 这个答案,我也对着检查了好久没看出有什么问题。直到把提示一开,卧了个大槽,原来不是“灭火”而是“王土”吗,太迷惑人了。通知 GPT 它就解出了答案 HID IN A STARE DOWN,当然“灭火”也是一道题,不过这就是二周目的事情了。
其它题目
其余题目都是 AI 的功劳,「蛹中蝶」似乎是它写了个脚本跑完了,「Meta: 图寻 - 终」它知道小题答案后就没花什么功夫。「Meta: 潮汐」这五题是队友和 GPT 做的。「纸说明书」是 Gemini 一遍跑完且通过的。「谜底写在谜面上」、「意犹未尽」、「Meta: 七日谈」、「Meta: 云室」也是队友和 GPT 做的,有部分猜的成分。
镜湖
湖边小径
说实话,当我发现这一部分的小题答案全都是 木 的时候,是真的笑傻了的。当然从这区开始,我基本就试图把题目完全交给 GPT 来做了,所以也没什么好记录的了,稍微说一下。
「Meta: 慧眼识才」和「Meta: 提笔成文」这两题是队友做的,他用了 AI 辅助,然后我睡前也是帮着填了几个词。「Meta: 多样性」有一些提示的情况对下对 GPT 并不难,剩余两题无提示的情况下 GPT 能秒。
湖心岛
有了上一区的经验,我很清楚底下的小题没有必要去做,四题全扔给 GPT 来跑,然后不一会儿就搞掉了「Meta: 历行和时间」和「Meta: 世界上最大的仙人指路」。「Meta: 理性和实践」在有主题的提示的情况下,GPT 能全部找对,但是我和它都错误地认为“鸡”是 chicken 导致了答案一直不对,后来它自己找到了另一个词 rooster 就解出来了。「Meta: 世界上最小的元谜题」在开了大部分提示的情况下,我直接要求它锁定单词长度是 6 个字母,而且说不定是重复的单词,这才让它做出来,不知道为什么它一直被这一部分的小题结构给迷惑了。
布道谷
玲珑心
这题 AI 很容易得到了 MAIN OPPONENT,但这居然不是里程碑,我检查了半天,最后应该是提醒它找另一个单词再删一个字母,才得到答案 ARCHIVAL。如果没有提醒或者说强制限定思路,它会去尝试各种奇怪的答案。
球形统计图
这题和队友一起做的,他看出来是地壳元素丰度排行,我们排完得到 a.social,然后卡了好久,AI 也在这最后一个奇怪的卡点上毫无进展……笑死了,队友一直在纠结其实是用在 meta 里的“拿铁”,然而这题答案就是 SOCIAL。
0 还是 1
没提示的情况下 GPT 无能狂怒的一题。队友找单词基本错了小半,我检查也和他一样没注意到每个单词必然是 AorB 结构,和 GPT 一样,我认为是 or 和 ro 代表 0 和 1 然后提取……开了提示才发现是这个意思,然后手动提取得到 morning。
■异常
和队友稍微看了下,我就发现这题的主题是颜色换了,然后一题题解就行,得到 WORLD。
各向异性
在规则上很有意思的一题,但是连线还是挺抽象的。我看出了规则讲给 GPT 听,它连了连但是并没有得到什么合理的句子,不过在最后一个提示开了以后,它似乎开窍了,得到那八个字并搜出答案 DOWNTOWN。
递归字谜
GPT 表现较差的一题,它对于这些异型汉字的识别实在是不敢恭维。不过它居然做出了第一个部分的答案,倒是后面三个部分全是我开提示的,最后里程碑 worm 的信息交给它就能出答案 SIERPINSKI TRIANGLE。
在骨牌游戏玩叠叠乐是否搞错了什么
做出来的过程比较好笑的一题,GPT 帮我把本题规则和大部分成语整理了,我看了看嫌烦,那就倒着开提示,哦,提示是个没用到的四字词语啊……哎等会儿,为什么一堆成语里混了个 千与千寻 进来?交!对了!!
出过的不许再!
GPT 很容易能看出本题的主题是重复字删除,然后它提出了分值和删除的字数一样的假设,我看了一眼帮它确认了这点。但它还是卡住了,主要是象棋那一题,于是我帮它开了提示,然后得到了 99 分。
GPT 的表现到此为止了,起码最后这个《荒原》变成《荒原狼》的操作是 Gemini 3.1 Pro 做出来的,最终满分通过。
Meta: 博采众长的布道者
笑死,让 GPT 做了半天,我和队友一眼也没看过,我觉得它做不出来就把提示全开了……然后队友问起这题怎么还没解决,看了眼发现 GPT 图片识别能力太差了,基本全错,于是两人手工提取,暴力得到 catch。
Meta: 力争上游的布道者
这题是我手做的,提示也算是全开了,找完后开始玩拼图,队友看出一个“豆”,然后我就看出了 壹。
Meta: 求知若渴的布道者
先让 GPT 做了一堆发现做不出来,变成我手做,我随手找全了四个花,但是却看不出答案,一直以为是 or 那个词不对,疯狂尝试。队友上来看了会交了 yuri 直接过了,原来我把「童话故事」里的 G 看成 C 了……
Meta: 光彩夺目的布道者
开了提示就没什么难度了,我找完词用输入法的拼字模式拼一下就知道怎么读了,找辅音不同的多音字得到 莘。
Meta: 和而不同的布道者
依旧提示全开,在没开提示前其实也理解得差不多了,只不过漏了两个小题里的箭头,也是最关键的开头的箭头和反义的箭头,最后得到 fist。
Meta: 有容乃大的布道者
提示全开,也不好做,除了拿铁、三只松鼠和三明治,啥也没看出来,大胆猜测加暴力得到 tunafish。
Meta: 布道谷的布道者
这题我看了眼 Meta 数量和题面自然而然觉得是七大罪,对应完成后不太清楚如何处理,结果 GPT 直接把答案 REALITY 爆出来了,一脸懵逼。它先猜答案,然后回头补了过程。
其它题目
「4 道各具特色的谜题 & 1 道特殊的元谜题 ■解谜寻宝」、「Meta: 兼爱众生的布道者」是队友和 GPT 一起做的。「念」只有最后一步的竹字头是我人工帮忙看出来的。「打点计时器」是我和队友做的,不过他好像是让 Gemini 做出来的。「童话故事」是最神奇的一题,在我完全没有干预的情况下,把所有提示扔给它,GPT 花了大概两天时间做出了此题,相当厉害了。
空悬蛛网
这个区域的结构非常的特殊,全部由小题构成,然后框可以调用别的题目的答案。以经验而论,我在三字谜这道题里已经见过这种结构了,所以也没有非常惊讶或者说惊艳了。
全部小题均解出,队友和我都努力地一点点啃完了整个区域,在此期间,GPT 基本上没有太大作用,全是图片导致它能做的题目非常的有限,人力依旧是这个区域的主力。
不过讲个笑话,我把 noise 写成了 noice 导致根本没发现某题有问题哈哈哈……这真是 GPT 检查出来的……
顺带吐槽一下,我怀疑测试根本没有好好地测试这个区域的题号显示,在我这里基本全是乱套的,我得换到干净无插件的 chrome 才能正常显示,似乎出题人没有考虑拥有超多浏览器插件和脚本的用户呢。另外,部分手机浏览器也是玩不了这个区的,题号依旧全炸掉。
私立科学馆
本区有特殊的轮盘机制,挺好玩的,可惜全让 GPT 玩了。
合成大汉字
GPT 做这题太慢了,当然其实是我没有设置代理导致的,算是 codex 的 bug 吧。然后这题就成我手做了,这题的目的就是让玩家熟悉一下轮盘中的字合成机制吧,也挺简单的,算是个教程。
拼好字
同理,因为 GPT 玩得慢,而且这六题非常简单,所以我就手做了,当然「拼好字:林间」我开了提示,知道了旋转可以作用于轮盘上的按钮。
平面群
队友带着 GPT 做了大半,知道答案是 ISOMETRIC,但是没法在规定次数内完成盲文复原。我做了上面的题知道了轮盘按钮可以组合,于是告诉 GPT 让它给出求解脚本,并且让它自己操作搞定了这题。
计数法
这五道题的机制是利用轮盘上的 +1、*2 以及组合机制,从 1 到达指定的数字。前三题我是手算的,最后两题是 Gemini 写的脚本算出来的。
驭蝶:我推的箱子
这是变种推箱子小游戏,相当好玩,不过我只玩了第一章,后面全是 GPT 一点点摸索着玩完的。这应该也是 GPT 花了最多时间的一道题,它弄出了各种各样的脚本作 BFS 搜索,也没有完成全部小题。
四大皆空
不得不说,我把 GPT 坑了,我以为这题是要把轮盘清空,结果是把四个按钮变成恒等算符。其实 GPT 没提示的时候已经弄了三个出来了,不过最后那个好像还是得稍稍提示一下才能出来。
其它题目
本区大部分题目都是队友带着 GPT 做的,我无话可说。吐槽一下「火 - 可怕的科学馆」这题 GPT 居然卡在最后一步多点几下按钮,实在是有点难绷。
岩心新城一期
这一区的解构就是地下的每两道小题中多余的部分可以组合而成地上的一道小题,为了省时省力,我把到底是怎么组合的提示全开了。
岩心新城地上
地上部分全是 GPT 做的,我丝毫没有参与,只不过我看它解得太慢或者错了太多次后,会为它开几个提示。
岩心新城地下
这个部分没写的题目都是 GPT 或者队友搞定的,我最多帮忙开了提示。
变形术引论
感觉能通过这题非常容易探查到本区域解构的,可惜我没看出来,GPT 也没看出来,当我开了提示知道哪两个碎片是多余的时候,基本 GPT 就知道红色箭头是组合字而不是读音了,那就结束了。我看到了《致酒行》和名句两个关键词,就得到答案 雄鸡一声天下白。
订正谜:国旗篇
这题实在太难了,做不了一点,真不怪 GPT 做不出来。倒数第二张图的纸笔是一丁点也做不出来,怎么拼都不对,算了。最后是靠着 GPT 猜出来“还在玩”的开头,以及反爆出来结尾是“笔”字,猜出了答案 还在玩纸笔。
文学实践
气笑了,真的。当我开出提示发现所有虚线框里的东西都不是提示的时候,真的太好笑了。就一句话,无论是我还是 GPT 都知道答案是 端午节 了。
该如何提取?(3000 注意力)
更是气笑了!其实 GPT 早就做出来了,但是我一直没有尝试提交中文答案,交的是 danchen,结果这个居然不是里程碑。我开了提示,人工反复检查,各种答案都试了一遍。直到进了二阶段看到别的队说这题答案是中文的时候,真无语了,最后是 诞辰。
洞洞迷
至今没有理解的一题,通过 meta 可以反爆出来是 天才。GPT 和我都在那十五个字组词上耗费脑筋。
终章
做到这里,看一眼排行榜,显然离完赛还有不小的距离。三道 Pre-meta 开了到底是什么 feeder 的提示后 GPT 很快就做完了。Final Meta 我看出了是成就,但是提取是用了提示的,之后 GPT 在引导下也能搞定。
不过此时我还没意识到答案不同带来的问题,这个区还有两道题是最后才解锁的,然后 feeder 答案不同造成的结果不同还是卡了我一下下的。
🦋蛹🦋
这区除了「🦋Meta: 经纬🦋」这题我是一眼瞪出了答案以外,其它全是 GPT 的功劳。当然普通题目和之前答案一样,照抄即可。
🦋布道谷🦋
实际上就「🦋光彩夺目的布道者🦋」这一道题,我和 GPT 刚做没多久,队友来了提醒一句,之前 GPT 把颜色当国旗解出了 RUSSIA……又是回旋镖。
🦋岩心新城一期🦋
一眼看出是两道 meta 交换了 feeder,之后 GPT 轻松秒掉。
🦋终章🦋
其它题目比较简单 GPT 可做,当然「🦋Pre-meta 2: 画廊🦋」用了提示。
🦋Pre-meta 4: 作茧自缚🦋
本区域最恶心的一道题,也是 GPT 的噩梦,这里拼图旋转,基本上只有人类才能做到。本题想法确实很好,但是这个找碎片的过程才是真正的折磨人,特别是某几道题故意设置得几乎一样。
当然首先提示开了如何提取的,其次在我的 RGB 像素级别对比的建议下,GPT 帮我写了个脚本锁定了几道题,然后我开始用 PhotoShop 玩耍。本题的遮挡关系做得不是很好,或者可能就是要裁剪小题,反正我设置了半透明,转一圈把五组五个字全都读了出来,然后交给 GPT 组词完成「🔍Final Meta: 幻想成瘾🔍」。
后记
首先,让我展示一下 LLM vs 人类的表格,纵向五类就是人和 AI 参与题目解答的百分比差别,横向是提示使用的情况。
| 人工智能 | 不完美的 AI | 五五开 | 努力的人类 | 能工智人 | |
|---|---|---|---|---|---|
| 要提示干嘛? | 蛹中蝶、Meta: 全勤奖、Meta: 主干道、Meta: 长长短短、Meta: 圆桌会议、Meta: 图寻 - 终、纸说明书、Meta: 我的变形术、Meta: 迷篱、Meta: 历行和时间、Meta: 世界上最大的仙人指路、语文考试吗?、形容、Lost Tiles、一光十色、Meta: 兼爱众生的布道者、计数法:1532、计数法:1532’、钟、地 - 沉星之序、Meta: 破碎诗、非对称谜题、太简单了!🦋Meta: 全勤奖🦋、🦋Meta: 主干道🦋、🦋Meta: 长长短短🦋、🦋Meta: 圆桌会议🦋、🦋Meta: 简单提取🦋、🦋小宇宙🦋、🦋Meta: 拼块🦋、🦋Meta: 七日谈🦋、🦋Meta: 云室🦋、🦋Meta: 移动🦋、🦋光彩夺目的布道者🦋、🦋Meta: 轮回🦋、🦋Meta: 破碎诗🦋、🦋Pre-meta 1: 橱窗🦋、🦋Pre-meta 3: 书架🦋、🔍Final Meta: 幻想成瘾🔍 | 图寻 - 色、图寻 - 角、玲珑心、念、平面群、驭蝶:我推的箱子、五子连珠、Meta: 轮回 | 参宿三、图寻 - 文、图寻 - 地、信息可视化 | 参宿一、图寻 - 形、■异常、打点计时器、Meta: 布道谷的布道者 | 参宿二、Meta: 腰带、Meta: 拼块、球形统计图、合成大汉字、拼好字:土木、拼好字:阶梯、拼好字:何意、拼好字:隔绝、拼好字:三重、计数法:42、计数法:54、计数法:766、🦋Meta: 经纬🦋 |
| 不上不下的提示 | 形形色色、风 - 逆飞的流冰、水 - A:B、四大皆空、梦到什么说什么、逃离马科夫、明知故问、守护汉语纯洁性、ChatPKU、Pre-meta 1: 橱窗、Pre-meta 2: 画廊、Pre-meta 3: 书架、Final Meta: 幻想成瘾 | Meta: 多样性、Meta: 理性和实践、各向异性、火 - 可怕的科学馆 | 递归字谜、在骨牌游戏玩叠叠乐是否搞错了什么、出过的不许再!、变形术引论 | 「空悬蛛网」整个区域、🦋Pre-meta 4: 作茧自缚🦋 | |
| 没提示怎么做啊! | ⿱艹洛⿱黑土、点寻、童话故事、二叠记、化合、守护汉语纯洁性、浮想联篇、🦋Pre-meta 2: 画廊🦋 | 文学实践 | Meta: 移动、Meta: 世界上最小的元谜题、该如何提取?(3000 注意力)、洞洞迷 | 0 还是 1、订正谜:国旗篇 | Meta: 博采众长的布道者、Meta: 力争上游的布道者、Meta: 求知若渴的布道者、Meta: 光彩夺目的布道者、Meta: 和而不同的布道者、Meta: 有容乃大的布道者、拼好字:林间 |
| 人工智能 | 不完美的 AI | 五五开 | 努力的人类 | 能工智人 | |
|---|---|---|---|---|---|
| 要提示干嘛? | 入馆须知、世界上第 1 好的 crossword、金手指、Xə⊥ɒ7、六角秘术、🟦⬜️🟦⬜️🟦⬜️、◻️◻️◻️◻️◻️◻️⬜️ ◻️◻️◻️◻️◻️◻️、入馆须知?、Double Down、秋水仙素、请提交这个单词、Easy as ΑΒΓ、密码锁、彩来踩去、踩来彩去、传送悖论、洗衣机、恒成立、-入馆须知- | 拼图 | 谜底写在谜面上 | Meta: 提笔成文、逆位时空 | 意犹未尽、Meta: 七日谈、Meta: 云室、Meta: 慧眼识才、奇点 |
| 不上不下的提示 | 4道各具特色的谜题&1道特殊的元谜题 ■解谜寻宝、地覆天翻、数与量、🟥◻️◻️◻️◻️◼️◼️、🟨⬜️🟨⬜️🟨⬜️ 🟨⬜️🟨⬜️🟨⬜️、◻️◻️◻️◻️◻️◽️◽️◽️◽️◽️、缺一不可、六角秘书 | 基尔霍夫广场 | |||
| 没提示怎么做啊! | 无一字 | Meta: 潮汐、Meta: 一色、Meta: 多元、Meta: 星夜、Meta: 巴别 | 有无有无 |
两个表格分别是我和队友的,从中可以看出,绝大部分题目其实都是 AI 完成的,甚至很大一部分都是完全由 AI 完成的,人只起到了一个帮它确认答案正确与否,已经帮它开提示的作用。不过实际上,AI 是可以操作浏览器自己开提示和提交答案的就是了。
队伍名称【Lost in Harem】,完赛用时 248 小时整,后续解出 444 道题目,排名 163。另外,队伍提交记录、题目数据统计和队伍共享文档可以在我的仓库中查询。
我们基本上全程使用 GPT 5.6 Sol Max 模型,并在合适的时候开了 fast,这个消耗量是十分巨大的,光我一人这几天的 token 使用量就高达 9.5B,以 API 价格计算对应总成本约 $9143。当然非常感谢队友的 Pro 20x 账号,以及那几天的多次用量 reset,再加上我从各种奇怪地方打野得到的渠道,导致我的实际花费基本是没有的。不过若以正规方式使用,且在没有重置的情况下,假设账号的周限制额度不缩水,大概需要三到五个 Pro 20x 账号才足以完成我们的解题工作。
从我们的使用情况上来看,GPT 5.6 Sol Max 对于常规的文字题目,它的表现非常惊艳,搜索、苦力、纸笔、逻辑、小游戏等题目可以说它能随便乱杀。在猜机制、对电波的题目上表现不错,但是很容易出现陷入歧途后无法自拔的情况,有种陷入了局部极小值跳不出来的感觉。对于图片题目,如果只是用图片表达一些逻辑关系或者文字信息,它会用各种奇怪的识别办法去保证准确地识别理解内容,但是如果是抽象的图片,并要求一定的联想能力,GPT 的表现就比较糟糕了。顺带一提,Gemini 在抽象图片方面做得还不错,会有意想不到的表现。
作为一个普通平凡的解谜玩家,GPT 很久也没有想出来的题目我也拿它们没什么办法,如果有提示,它的理解和执行速度也会远超我。不过要说有什么缺点,GPT 目前的速度还不是让我满意,对于简单题目和重复性较强的题目,或者是需要交互的题目,它比较拖沓。原因想想也知道并不一样,简单或者重复性高的题目它会过度思考,导致很慢,这方面我估计修改一下思考强度算是一个解决办法,或者可以去期待各厂模型的进化。对于需要交互的题目,可能是浏览器 MCP 插件的问题,比如我发现没有特别设置 MCP 的代理的情况下它的操作延时高达 20s,后来我临时修了这个问题才让它拥有不错的交互表现,这应该算是 ChatGPT 桌面端的 bug 吧。
在这个时代的时间节点上来看,LLM 已经可以说是 cover 了各行各业的工作了,我认为解谜能力算是一个很好的量化指标,非常多样的题目可以测出模型的综合能力。甚至这种能力的测量可以说是比很多传统的 benchmark 更加合理,毕竟不太可能会有哪个厂会专门针对 puzzle hunt 去刷分嘛。要说哪方面测不出来,可能创造力和美学方面不在 puzzle 的考察范围内,这个就见仁见智了。
希望不远的未来有更廉价更好用的模型,让人类的偷懒水平更上一个台阶。