研究筆記

AI 工具、證照、讀書與動手實驗:一邊學,一邊記下來。共 62 篇。

同一個模型,一個榜給 62.7 分,另一個榜給 99.9 分,你該信哪個
🎧瀏覽 16 次

同一個模型,一個榜給 62.7 分,另一個榜給 99.9 分,你該信哪個

Caleb Writes Code 拆開 GPT-6 Astra 的發布:十四個跑分裡只有一個跟主流綜合榜重疊,同一個模型在同一個測驗上,換一套執行框架分數從 62.7 變成 99.9。他提出一個新尺:省 token 不等於省錢。我拿自家一週的帳來對,發現輸出 token 只佔帳單 8%,跑分在量的那一小塊,剛好是我最不痛的那一塊。教育性整理與延伸,不是購買建議。

四家 AI 訂閱,誰剩得多就派誰:我怎麼用一行額度表排 AI 的班
🎧瀏覽 17 次

四家 AI 訂閱,誰剩得多就派誰:我怎麼用一行額度表排 AI 的班

同時付四家 AI 訂閱,週額度、月額度、五小時額度各算各的,靠記憶派工的結果是一家爆掉一家閒著。我把開源儀表 CodexBar 的讀數接成一行燈號,每次開口前先看誰剩得多,再決定機械活、寫程式、下判斷各派給誰。四條不看額度的固定規則也一起講。教育性整理與個人做法分享。

一個請求十美元:掄錘者被 GPT6 Astra 燒掉餘額那天,我回頭看了自己的帳
🎧瀏覽 20 次

一個請求十美元:掄錘者被 GPT6 Astra 燒掉餘額那天,我回頭看了自己的帳

掄錘者實測 GPT6 Astra:網頁聊天三題花一美元,接進 Codex 一個小任務就把七美元餘額燒成負的。他的結論是我們窮,模型並不貴。我拿自己一天的 AI 用量對了一遍,發現帳單算的是它讀了多少,不是它答了多少。教育性整理與延伸,不是購買建議。

訂閱比按量划算得多,那他為什麼還是不敢一次丟六個任務
🎧瀏覽 25 次

訂閱比按量划算得多,那他為什麼還是不敢一次丟六個任務

掄錘者被留言逼著用訂閱制重測 GPT6:同一個小任務,昨天走 API 花九美元,今天走訂閱只吃掉一週額度的 4%。他認了訂閱划算,卻說不敢再像用便宜模型那樣一次丟六個任務。我把自家一週的用量照牌價算了一遍,發現訂閱是把錢換成一個會重置的時鐘,省下來的錢只是表面。教育性整理與延伸,不是購買建議。

陶哲軒說機率只有在事情會重複時才是對的尺,那我手上那些只發生一次的決定呢
🎧瀏覽 16 次

陶哲軒說機率只有在事情會重複時才是對的尺,那我手上那些只發生一次的決定呢

陶哲軒在 Big Think 講了八十分鐘他的新書《六個數學要素》。我聽完留下四件事:機率的適用邊界、加倍下注是把破產壓進一個小機率、事故排除後塞車還會持續、以及一個初期比較不準的正確模型會被資料淘汰。我拿自家的驗證簿與結算扇校準來對,這四件事每一件都戳到我。教育性整理與延伸,不是投資建議。

他要的答案是「不」,AI 給了他好幾頁的「是」
🎧瀏覽 18 次

他要的答案是「不」,AI 給了他好幾頁的「是」

陶哲軒說數學家要兩樣東西:答案,跟理解。幾百年來這兩件事分不開,因為要拿到答案你非得先懂不可。現在分家了——題目被沒有領域專業的人解掉,答案是對的,也驗得過,可是沒有人知道發生了什麼。他說 AI 缺的是刪掉的能力,不是生成能力。我拿自家一盞壞掉的警報燈和一份 16 KB 的教訓檔對了一遍。

今年我買了一套很貴的美股資料,然後找到這份公開的
🎧瀏覽 16 次

今年我買了一套很貴的美股資料,然後找到這份公開的

介紹一份公開的美股歷史資料:日線股價、法說會逐字稿、財務三表、公司新聞,而且下市公司的歷史都留著。一個付費用戶的實測心得,附開始使用的方法與一個該注意的地方。教育與方法論用途。

AI 改 AI,不一定要改腦子:聽小天講 EvoX 的蜂群
🎧瀏覽 22 次

AI 改 AI,不一定要改腦子:聽小天講 EvoX 的蜂群

小天用十分鐘講一個問題:AI 自我改進一定要改模型權重嗎?他拿 EvoX 的蜂群模式當例子,主張人類文明靠的是制度和協作在進化,AI 也可以。我拿自家跑了半年的兩條「AI 改 AI」迴圈對照,發現偵測做到了、自改沒發生,而蜂群缺的那件事我今天早上剛親身撞到一次。教育性整理與延伸。

Graph Engineering 是什麼?管一群 AI agent 要畫兩張圖——一張幾個月不動,一張用完就丟
🎧瀏覽 20 次

Graph Engineering 是什麼?管一群 AI agent 要畫兩張圖——一張幾個月不動,一張用完就丟

Graph Engineering 七月在 X 上爆紅:一則推文、一個半小時後 Google 產品經理接話定義、48 小時文章潮。Kelly Tsai 的影片把它講清楚——迴圈寫出 agent 的行為,圖寫出 agent 的組織;實作上是兩張圖:穩定的組織圖加用完就丟的分工表。我拿自己管一群 AI 的日常對了一遍,連怎麼長出來的過程都一樣。

Codex、DeepSeek Harness、Hermes 誰最好用?實測的答案是:沒有最好用的 agent,只有站對位置的 agent
🎧瀏覽 23 次

Codex、DeepSeek Harness、Hermes 誰最好用?實測的答案是:沒有最好用的 agent,只有站對位置的 agent

一支實戰影片把三個 AI agent 工具丟進真任務:開發論壇皮膚、修 bug、日常運維防攻擊。結果 Codex 最會開發、Hermes 最穩能連跑一個月、代碼最漂亮的 DeepSeek Harness 反而翻車。搭配本地 Qwen3.8 27B 吃粗活、雲端 DeepSeek V4 Flash 收尾,一天測下來只花 30 元人民幣;全接高階模型要 100 多元,兩個月差價就是一張 4090。

陶哲軒的硬幣遊戲:AI 解數學做了四件事,人也做了四件事,我把自己的分工表拿去對了一遍
🎧瀏覽 13 次

陶哲軒的硬幣遊戲:AI 解數學做了四件事,人也做了四件事,我把自己的分工表拿去對了一遍

陶哲軒用一個硬幣遊戲示範人和 AI 怎麼合力解開一題數學:Gemini 補證明缺的一步、AlphaEvolve 算到 16 堆、Aristotle 把證明翻成 Lean 讓機器驗,而出題、猜想、看懂證明、認出兩題其實是同一題,全是人做的。AI 四件事、人四件事,這張分工表跟我自己派 AI 幹活的原則幾乎一樣:驗收能交給機器的,才放心交給 AI。

便宜的夠用,貴的用不完:聽掄錘者講怎麼選模型和 agent
🎧瀏覽 16 次

便宜的夠用,貴的用不完:聽掄錘者講怎麼選模型和 agent

掄錘者用十八分鐘把他這幾個月測過的模型和 agent 排了一次隊:本地只認 Qwen3.8 27B,線上首推 DeepSeek V4 Flash,日常助手用 Hermes、寫程式用 Codex,Gemini 和 Grok 直接勸退。他的排隊方法比排隊結果更值得學:先問你一個月用多少、任務要跑幾步,再決定付誰的錢。我拿自己這一個月的實測數字對了一遍,有兩處跟他一致,一處相反。

本地大模型要買卡還是租卡?RunPod 一小時 24 元台幣,我實際跑過之後怎麼想
🎧瀏覽 26 次

本地大模型要買卡還是租卡?RunPod 一小時 24 元台幣,我實際跑過之後怎麼想

昨天我第一次在 RunPod 租雲端 GPU 跑一個小批次任務:一張 4090 每小時約 24 元台幣、按秒計費,四輪嘗試、567 秒 GPU 時間,帳單三塊四。這篇把「租」和「買」兩條路的形狀攤開來比:什麼時候租划算、什麼時候該買,還有本地端開發常見的幾種應用——文件向量索引、截圖批次判讀、本地模型當 agent 腦袋、微調、生圖生影片——各自該租還是該買。程式實作及測試由好友 Fred 協同開發。

只給分子不給分母:陶哲軒說 AI 解題像個微醺的天才,而我們可能在優化錯的東西
🎧瀏覽 9 次

只給分子不給分母:陶哲軒說 AI 解題像個微醺的天才,而我們可能在優化錯的東西

陶哲軒在一段訪談裡把 AI 做數學的現況講得很白:四年從國中題爬到解開幾個人類卡住的問題,但成功率、燒了多少錢、掃了幾題才中一題,全是黑箱。他的比喻是一個懂得很多、有點醉的人不停丟點子,指一千題給它,解掉五十題,但不一定是你最想解的那五十題。我拿自己做因子驗證的登記簿對了一遍:分母沒人記,是我們自己也犯過的錯。

資策會 AICE 人工智慧工程素養:一週衝刺的考取筆記
🎧瀏覽 52 次

資策會 AICE 人工智慧工程素養:一週衝刺的考取筆記

教育性備考心得:AICE 考試題型、最容易搞混的觀念、我們的準備方法,以及及格關鍵的取捨策略。

AICE 必考觀念筆記:一頁把四大面向的地基打完
🎧瀏覽 88 次

AICE 必考觀念筆記:一頁把四大面向的地基打完

教育性整理:AICE 人工智慧工程素養認證的必考觀念——評估指標、機器學習、大數據生態系、神經網路、生成式 AI 與 AI 倫理,附記憶鉤。

看過的影片找不回來?我把「影片記憶」整套搬回自己電腦
🎧瀏覽 10 次

看過的影片找不回來?我把「影片記憶」整套搬回自己電腦

從一支開源插件出發,把「看影片自動變成可搜尋的向量記憶」的整條鏈路——採集、嵌入、儲存、查詢——全部搬回本地的過程紀錄。一個晚上、三個坑、零雲端服務。

本地模型 Qwen3.8 27B 適合你嗎?
🎧瀏覽 44 次

本地模型 Qwen3.8 27B 適合你嗎?

看完兩位 YouTuber 三支硬體實測影片後的綜合心得。從一次回本計算出發,拆解在自己家裡跑大模型的三個真實成本,以及怎麼判斷這件事適不適合你。工具選擇的思考練習,非採購建議。

當結束碼開始說謊:一個響了七天沒人聽懂的警報
🎧瀏覽 9 次

當結束碼開始說謊:一個響了七天沒人聽懂的警報

自動化系統的靜默故障:工具答對了卻回報失敗、警報每天都響卻喊錯名字。一次除錯的完整推理過程,以及三個可以直接拿去查自己系統的檢查項。

別讓 AI 說「沒問題」:一套逼它重算的規則
🎧瀏覽 14 次

別讓 AI 說「沒問題」:一套逼它重算的規則

朋友花了一整晚跟 AI 說圖表數據有問題,AI 一直回沒問題,發火之後它才承認有一組量測把平均拉低了。問題不在它不夠聰明,在於沒有東西逼它重算。這篇把我兩年累積的十七條規則整理成一隻公開的 skill,每一條都附當初付出的代價。

當天才決定離開:從 Grok 追上前沿、Google 人事地震到 Meta 重返開源
🎧瀏覽 31 次

當天才決定離開:從 Grok 追上前沿、Google 人事地震到 Meta 重返開源

聽完科技浪 EP150 的心得筆記。從三件事拆一個判讀方法:技術路線一旦收斂,明星研究員的邊際貢獻就會下降——這對看新聞做決策的人意味著什麼。教育性內容,非投資建議,不含個股推薦或目標價。

硬體為什麼難:一集對談裡最值錢的三句話
🎧瀏覽 11 次

硬體為什麼難:一集對談裡最值錢的三句話

沒有事後更新、太熱情的供應商是警訊、時間買不回來——Supply Chained 用二十分鐘拆掉硬體創業的浪漫。反過來讀,創業者的痛苦清單,正是投資人的護城河清單。

沉舟側畔千帆過:聽掄錘者談 AI 內容工廠——流量去哪了、誰在跟誰競爭,和一個三五年的窗口
🎧瀏覽 13 次

沉舟側畔千帆過:聽掄錘者談 AI 內容工廠——流量去哪了、誰在跟誰競爭,和一個三五年的窗口

一位中國接案工程師的 YouTube 頻道罕見地不談硬體,談自己身處的行業:創作者流量崩塌。短影音分流疊加 AI 批量工廠,一個人能同時經營十個頻道;平台偵測 AI 內容的能力有到期日,而且已經在誤殺真人。他的結論是你的對手是掌握 AI 的人;他的自救是拿「還能證明自己是真人」的三五年當窗口。我的延伸:內容可以批量,臨場不行;臉會過期,紀錄不會。

herdr:同時養一群 AI agent 的人,遲早要回答「誰在做事、誰卡住了」
🎧瀏覽 13 次

herdr:同時養一群 AI agent 的人,遲早要回答「誰在做事、誰卡住了」

herdr 是什麼、怎麼裝、怎麼用,以及我們沒把它裝進生產線、卻把它最好的兩個設計搬回家的經驗——教育與方法論分享。