網易首頁 > 網易號 > 正文 申請入駐

親測OpenAI o3的10個案例,20美金/月雇跨學科博士做助理

0
分享至

一直以來,OpenAI 的o1模型都是推理模型的巔峰,其DeepResearch功能就是憑借o系列的基座能力,在市場上贏得了口碑。

不過,可能生成報告的模式,讓大家始終覺得搜索升級沒啥看頭,大家很難體會AI的研究能力。

在昨晚發布的o3和o4、o4 mini模型中,實現了以下能力的躍遷:

整體推理能力:對真實、復雜任務的專家打分顯示,o3 的重大錯誤比上一代?o1?少?≈20?% ?視覺多模態:在大學水平的多學科視覺推理基準?MMMU,o3 82.9?%?→?GPT?4 34.9?%,絕對提升?≈48?分,相當于 2.4?× 的相對提升 ?競賽數學:AIME?2024 單次作答 o3 91.6?%,而 GPT?4o 只有 12?% 左右,提升 >7?× ?上下文長度:o3 200?k 輸入窗口?vs?GPT?4 8?k,且輸入/輸出 token 價格僅為 GPT?4 的約 1/3?2/3

AI呈現了一定程度的研究能力,為了能讓大家更直觀感受到大模型在各個領域場景下,高水平處理任務的能力。

鯨哥實測了10個案例,我們能看到o3的分步推理思考過程,很多復雜的問題真正在研究,以及利用工具解決!


1、化身福爾摩斯,看圖猜測背景信息:

鯨哥在o3上傳了一張菜單,要求ChatGPT猜出來是哪家飯店。

可以看到o3分析了菜品和價格,并搜索了大眾點評的數據,提出指紋式的菜名+價格組合只有在四季民福出現,最終答對了!


2、識別圖片內容信息,成為植物學家:

識圖能力在此前的眾多大模型中都已經具備,但這次是給大模型加大難度,用一大束花,讓GPT識別都有哪些花束。

最終o3識別出了8種主要的花束,展現了對復雜內容的理解。


3、做考公 圖推題,o3當小學題題目做

在考公題目中,經常有圖推題出現。這些題目往往具有一定的難度,考驗模型對圖片理解以及意識推理的能力。

這道考公題并不容易,GPT用幾種形狀來找規律,最終選擇了答案D。當然,這道題也有爭議,粉筆網給出的答案是D,但很多人認為是B。

只是19秒做完這題,o3估計覺得這題沒多復雜,都是小學生題。


4、數學計算能力更強,重大錯誤比o1強20%

在數學計算中,此前o1開始計算哥德巴赫猜想,讓大家吃了一驚。當然,也沒有計算出來,卻顯示出推理大模型的強悍之處。

鯨哥拿一道DeepSeeK做錯的數學題,考驗o3的進化能力。

這道題不太難,但是DS的幻覺率需要人為矯正。

而o3很快就得出了正確答案,數學題是推理模型的阿克琉斯之踵,o3有進步。


5、調用OpenAI內部工具,除了不能做視頻

在這里,我們先讓o3深度調研下『2025年北京夏天可能火的食物』這一主題。o3從全網內容中獲取了最新的5款食物銷量,得出了結論。

o3最看好 乳茶2.0這款產品,接著讓o3做一張輕乳茶2.0的宣傳海報,o3會思考任務交代中沒有明確提示要Midjourney生成,那就是不僅要生成Prompt,還需要調用4o模型直接生成圖片。

接著我們讓o3直接生成輕乳茶的電商網頁,以動態可視化的HTML網頁形式運行。現在GPT還可以直接運行代碼,實時預覽,很方便。

可以看到右下角還有修復提示,這也是本次o3的重要提升,當它意識到程序有Bug時,就會實時提示可以修復真實代碼,這對于AI編程落地很關鍵。


6、創意視頻生成,后續結合Sora才有前景

o3其實作為LLM,本身不支持生成視頻,但是我們還是要求他生成視頻,考驗它解決問題的思路,這里鯨哥給到的是飛機和魚的創意故事。

o3是逐幀生成了圖片,然后做成gif形式的視頻。

可以看到最終生成的視頻內容,是一架飛機路過,伸出了魚鉤,釣起魚飛走了。這個創意讓我想起來一個歌:『海鳥與魚相愛,只是一場意外』


7、代碼能力和真實物理能力測試

這次公告中,官方稱在“修 bug”基準?SWE中,o3 解決?69.1?% 問題,而 GPT?4o 只解決 33?%左右,代碼能力 ≈2?倍提升。

實測中,生成代碼的審美確實沒什么進步,以下是o3生成的100個小球碰撞的物理實驗,這個效果差強人意。

和下圖對比看,相比o1的還遜色不少,o系列模型確實在代碼編程方面,始終沒有超越Claude3.7。尤其前端UI這塊,水平還是差不少,GPT-4.1也不行。


8、科技商業問題推理,最終寫成文章

在這道題中,鯨哥用比較有門檻的科技商業文作為寫作題目,而且要求中間插入數據分析以及戰略路徑歸納,最終得出結論。

生成的分析深度還可以,只是沒學會吳曉波老師的文筆。

一直以來,ChatGPT的寫作能力都略遜Claude3.7,從目前看,語言的風格化以及潤色程度,比3.7確實還有距離,但是數據和邏輯分析,以及概念的引用都不錯。像是個不經常寫文章,而是經常做研究的博士,寫出來比較硬的內容。


9、視頻分析能力,對多媒體的理解能力

我們在Youtube上找了個萬人大合唱的合集,然后讓他分析這是什么內容,以及為什么能爆火。

o3解讀出了都包括哪些歌,然后分析了爆火的底層邏輯。感覺對于IP孵化類博主是個福音,大家以后能用o3直接寫爆款分析課程了。


10、生成深度研究報告,o3表現更好

我們調用o3模型的深度思考能力,生成了一份行業報告。o3用了不到20分鐘生成了這份1萬多字的報告。

還是先思考后搜索的思路,內容較o1版也有一定程度的提升。

報告全文在這里:https://chatgpt.com/share/6800bf78-bac8-8005-82e4-07c686e121e6

o4mini更適合批量客服回答等強調性價比場景,所以本文沒有測試。Altman還提到,o3 Pro版本將在未來幾周內到達,能力應該比本文測試的o3更強,但也意味著價格更貴。

在Plus賬號中,你能大范圍使用ChatGPT 的所有能力,尤其o3的20美金每月費用,相當于花近200多元雇傭了一個跨學科博士生在身邊做助理,大家覺得值不值呢?

視頻內容推薦:

特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關推薦
熱點推薦
廣東隊將會賺得盆滿缽滿!

廣東隊將會賺得盆滿缽滿!

體育哲人
2026-04-26 08:30:08
伊朗稱已成功摧毀三枚美國巨型鉆地彈

伊朗稱已成功摧毀三枚美國巨型鉆地彈

新京報
2026-04-26 18:58:06
1981年,女活佛見到陰法唐中將的妻子李國柱:做夢也沒想到

1981年,女活佛見到陰法唐中將的妻子李國柱:做夢也沒想到

瑩瑩的歷史說
2026-04-26 07:57:33
伊朗突然取消會談,特朗普當場發火,霍爾木茲海峽油輪停了三天。

伊朗突然取消會談,特朗普當場發火,霍爾木茲海峽油輪停了三天。

記錄生活日常阿蜴
2026-04-26 19:20:22
關曉彤最新官宣,已與鹿晗無關

關曉彤最新官宣,已與鹿晗無關

泠泠說史
2026-04-25 20:47:20
山西女籃3外援為何不敵單外四川?于琦末節一次錯誤用人葬送冠軍

山西女籃3外援為何不敵單外四川?于琦末節一次錯誤用人葬送冠軍

南海浪花
2026-04-26 07:07:58
回顧 上海老人摔倒1小時,路人怕被訛無人扶,到醫院后竟賴上護士

回顧 上海老人摔倒1小時,路人怕被訛無人扶,到醫院后竟賴上護士

談史論天地
2026-04-25 14:00:08
笑麻!在高架上看到這個真沒有繃住,不是親眼所見,真不敢相信

笑麻!在高架上看到這個真沒有繃住,不是親眼所見,真不敢相信

黃麗搞笑小能手
2026-04-26 05:57:14
體制內硬剛領導會是什么下場?網友"鐵頭娃"式回答,大徹大悟

體制內硬剛領導會是什么下場?網友"鐵頭娃"式回答,大徹大悟

夜深愛雜談
2026-04-24 07:32:39
美國與北約關系持續惡化 歐盟各國尋求互助應對外來威脅

美國與北約關系持續惡化 歐盟各國尋求互助應對外來威脅

國際在線
2026-04-25 19:09:05
19歲小伙連吃幾天小龍蝦,劇烈頭痛、行走困難!確診為“橫紋肌溶解癥”

19歲小伙連吃幾天小龍蝦,劇烈頭痛、行走困難!確診為“橫紋肌溶解癥”

環球網資訊
2026-04-26 07:43:11
深圳那位用飲料澆滅煙頭的女生,到底經歷了什么

深圳那位用飲料澆滅煙頭的女生,到底經歷了什么

大張的自留地
2026-04-26 08:52:35
長期不住的房子,物業費能少交嗎?民法典早說了,別再交冤枉錢!

長期不住的房子,物業費能少交嗎?民法典早說了,別再交冤枉錢!

老特有話說
2026-03-11 14:47:30
隨著長春亞泰1-2領頭羊,無錫吳鉤0-0,中甲最新積分榜出爐

隨著長春亞泰1-2領頭羊,無錫吳鉤0-0,中甲最新積分榜出爐

凌空倒鉤
2026-04-26 17:33:05
村干部要“交差”了!上面下死命令,多數村莊必須拿出創收成績單

村干部要“交差”了!上面下死命令,多數村莊必須拿出創收成績單

老特有話說
2026-04-26 15:51:30
斯諾克世錦賽:趙心童擴大優勢!10-8領先丁俊暉,吳宜澤迎首勝!

斯諾克世錦賽:趙心童擴大優勢!10-8領先丁俊暉,吳宜澤迎首勝!

劉姚堯的文字城堡
2026-04-26 18:23:48
互聯網是有記憶的,她的黑歷史一大堆啊!

互聯網是有記憶的,她的黑歷史一大堆啊!

BenSir本色說
2026-04-15 22:38:07
25萬,逆天啊...

25萬,逆天啊...

放毒
2026-04-25 17:06:44
消息人士:白宮記協晚宴安全事件嫌疑人作案目標為美政府官員

消息人士:白宮記協晚宴安全事件嫌疑人作案目標為美政府官員

新京報
2026-04-26 13:39:07
《最強大腦》水哥現狀:46歲不上班,住熱帶雨林,靠腦子年入千萬

《最強大腦》水哥現狀:46歲不上班,住熱帶雨林,靠腦子年入千萬

子芫伴你成長
2026-04-19 23:08:37
2026-04-26 20:31:00
鯨選AI incentive-icons
鯨選AI
最新AI產品化與商業化案例速遞
152文章數 38關注度
往期回顧 全部

科技要聞

漲價浪潮下,DeepSeek推動AI“價格戰”

頭條要聞

特朗普內閣又一女部長落馬:強迫男下屬為其提供性服務

頭條要聞

特朗普內閣又一女部長落馬:強迫男下屬為其提供性服務

體育要聞

森林狼3比1掘金:逆境中殺出了多孫穆?!

娛樂要聞

僅次《指環王》的美劇,有第二季

財經要聞

事關新就業群體,中辦、國辦發文

汽車要聞

預售19.38萬元起 哈弗猛龍PLUS七座版亮相

態度原創

手機
藝術
教育
數碼
公開課

手機要聞

一加Ace 6至尊版規格全揭曉,堆料堆到友商沉默!

藝術要聞

18幅 列賓美院教師Artem Tikhonov風景寫生

教育要聞

休學率上漲,驚到很多人!北大六院醫生直言:這背后其實是夫妻關系和家庭關系……

數碼要聞

一加120W充電寶有多猛?30分鐘充68%

公開課

李玫瑾:為什么性格比能力更重要?

無障礙瀏覽 進入關懷版