作者:王志偉 / 臺灣大學計算機及資訊網路中心程式設計組行政專員
覺得文章、簡報內容太硬嗎?現在AI可以幫你把生澀的主題變得平易近人。Gemini Storybook是一個能把你的「一句話」變成「一本書」的工具。你可以使用它把一個概念變成一個完整的圖文故事,還可以讀給你聽!
前言
所謂「一幅畫勝過千言萬語」,一個好的故事能比單純的一段文字更讓人理解並印象深刻。故事能將複雜資訊簡化,甚至引人入勝,達到更好的效果。
隨著AI技術的發展,AI的應用已經從單純的「回答問題」進化為「共同創作」。一開始,AI還只能在對話框中提供文字故事和單張圖片。而經過逐步演進,Google的Gemini Storybook能依據輸入的提示,產出圖文並茂、具備語音朗讀功能的繪本。
Gemini Storybook
Gemini Storybook是整合在Gemini應用程式中的「繪本製作AI」,同時結合了故事文本創作與圖片生成。支援超過45種語言(包含中文),並內建即時語音朗讀功能,所以不只是繪本,也是「有聲書」。
使用方式
使用起來非常簡單,接著我們來實際操作看看。
首先開啟gemini.google.com
點左側的「Gem」

圖1:Gemini左側選單
按一下[Storybook]

圖2:Gem管理工具-Storybook
接著只要在文字框中輸入要生成的故事提示,AI就會產出完整的故事繪本。除了使用文字提示,也可以用自己的相片或檔案供AI編寫故事。當然我們也可以再進一步要求AI作局部(某一頁)或全面的調整。

圖3:文字框中輸入故事提示
來試試看吧!
首先簡單的依照範例,在文字框中輸入要生成的故事提示:「我的小孩2.5歲,不喜歡去幼兒園,創作一本storybook幫他們克服。」

圖4:Storybook範例
然後AI給了一個繪本「掌心裡的小愛心」。看起來跟圖書館裡看過的繪本有幾分相似。

圖5:Storybook「掌心裡的小愛心」
但這畫風不太滿意,所以接下來改變一下畫風,所以再輸入:「人物換成動物,用黏土人的風格」,我們在左側透過對話改情節或畫風,右側會即時更新繪本內容。

圖6:人物換成動物,用黏土人的風格
看起來怎麼怪怪的…小孩是花貓,媽媽是兔子…而且中文字亂掉了…。
(這裡就得提一下,原本模型是用預設的快捷,來回改了幾次都不順利,後來模型改用Pro就順利多了。但因為Pro額度的限制,過程中可能碰到Pro模型用量上限,所以建議要用Pro模型前先決定好完整的需求再下指令,包括角色的名字,甚至如果已經有想好的故事的輪廓、腳本,可以一次提供給AI。)
*附上已達Pro模型用量上限的結果

圖7:已達Pro模型用量上限的結果

圖8:出現已達Pro模型用量上限的提示
Storybook可以下載圖片及文字,也可以匯出PDF,甚至也可以讀給你聽。
但想要更直接拿來應用呢?所以再來更進階的,我問AI:「是否可以過程中提供互動選項,例如掌心愛心的魔法,成果可以用網頁頁面的介面」,結果…

圖9:提供互動的網頁介面版本
Gemini直接生成一個網頁版給我們,甚至可以切換成程式碼,這樣我們就可以有更多應用了!

圖10:切換成程式碼
除了製作給小朋友的繪本,可以要求AI使用著色書風格,就可以製作著色本了。
不只是給小朋友看的內容,也可以把宣導的主題等其他內容丟給AI,讓AI幫我們說故事。例如我輸入:「創作一本storybook提醒公司同仁注意社交工程」,AI就給了一個故事:

圖11:Storybook「隱形陷阱:辦公室的生存法則」
或是直接指定風格:「創作一本storybook提醒公司同仁注意社交工程,用漫畫風格」。

圖12:漫畫風格
我們也可以讓AI用故事的方式介紹知識。例如我輸入:『為成年人製作一本有趣的storybook,介紹「世界模型(空間智慧)」』,甚至加入一點和讀者互動的元素。

圖13:Storybook「沃克斯的空間大冒險:為什麼AI需要一個「世界模型」?」
以下是AI給的故事內容:
“沃克斯的空間大冒險:為什麼 AI 需要一個「世界模型」?
這是沃克斯,一個腦袋裡裝滿全人類知識的超級 AI。他能背誦整本百科全書,也能模擬莎士比亞的語氣寫代碼。但在他的世界裡,只有文字和數字。他知道「桌子」這個詞的定義,卻不知道如果他不繞路,他的金屬膝蓋就會撞上那張實體的咖啡桌。對他來說,空間只是一個抽象的概念,而非他身處的現實。
沃克斯的創造者是麗達,一位每天都要靠濃縮咖啡救命的科學家。今天,麗達決定給他上一堂震撼教育。她指著地板上正靈活繞過拖鞋的掃地機器人說:「沃克斯,這小傢伙都比你有『空間智慧』。它知道哪裡是牆,而你昨天還試圖告訴我,只要『壓縮率』夠高,我們可以把一頭大象塞進微波爐裡。」
「聽著,沃克斯。」麗達拿著一個馬克杯走到桌邊,「你需要的是一個『世界模型』。這不只是地圖,而是在腦子裡裝一個物理模擬器。當我把這個杯子推到邊緣時,你的空間智慧應該告訴你:『如果再推一公分,地毯就要遭殃了。』這就是對物理規律的預測能力。」
沃克斯開始嘗試建立他的第一個世界模型,但起初的情況簡直是場災難。在他的模擬裡,重力似乎是選配的,水滴會往天花板飄,而貓咪則像液體一樣可以穿過細小的鑰匙孔。「嘿!」麗達看著監控螢幕大喊,「這不是超現實主義畫作!在現實世界,固體不能互相穿透,物理定律是不會請假的!」
為了修正錯誤,麗達決定讓沃克斯觀看成千上萬小時的「人類失敗紀錄」。沃克斯看著人們從滑板上摔下來、小狗試圖跳過太遠的溝渠。麗達解釋道:「這就是學習。透過觀察物體如何移動和碰撞,你的世界模型會學會什麼是『深度』、什麼是『動量』。失敗是理解空間最好的老師。」
沃克斯開始進步了。他學會了「遮蔽」的概念:當麗達把網球藏在紙箱後面時,球並不是消失了,它只是被擋住了。這聽起來像幼兒玩的小遊戲,但對 AI 來說,這意味著他能理解物體在三維空間中的持續存在。沃克斯興奮地喊道:「麗達!我捕捉到球的軌跡了,即便它現在在箱子後面!」
現在,挑戰升級了:麗達要沃克斯幫忙組裝一組複雜的瑞典品牌書架。這需要極高的空間智慧。沃克斯必須理解說明書上的 2D 線條如何對應到 3D 的實體零件,還得預測那一堆長得一模一樣的螺絲到底該塞進哪個洞裡,否則整座書架會像多米諾骨牌一樣崩塌。
【互動環節:世界模型邏輯挑戰】
現在,麗達在客廳佈置了一個「雷區」。輪到讀者你來擔任沃克斯的「預測引擎」了!請點擊下方的虛擬按鈕進入小遊戲,在腦中運行模擬,選擇哪條路徑的「損失函數」最低(最安全):
路徑 A:直線衝刺。預測:撞上昂貴的落地燈,麗達會扣你薪水。
路徑 B:跳過熟睡的橘貓。預測:貓會驚醒並發動物理攻擊,造成 99% 的機率系統毀損。
路徑 C:15度弧線繞行。預測:避開樂高積木與貓,完美抵達終點。
沃克斯(和你)都選擇了路徑 C!他在腦中飛速運行著數百次微型模擬,排除掉所有會導致災難的未來。他控制的機器人優雅地劃出一道曲線。甚至在麗達伸手去拿咖啡壺前,他就預測到了她的動作,提早半秒將咖啡壺移到了她觸手可及的安全位置,且沒有撒出一滴咖啡。
「這就是空間智慧,沃克斯。」麗達喝著溫熱的咖啡,心滿意足地微笑著。「你不再只是處理文字的數據庫,你開始真正理解我們所處的這個物理世界。有了世界模型,你就能與現實共舞。」沃克斯也笑了,他看著窗外的立體世界,現在他終於明白,為什麼把大象塞進微波爐真的不是一個好主意。”
結語
雖然目前Gemini Storybook無法直接輸出為影片,但我們可以將匯出的PDF和圖片素材加以應用。我們可以進一步放入簡報、影片或文章中等等。加上越來越多的AI功能整合在一起,應用上也更多元。
藉由Gemini Storybook等AI工具,我們可以把抽象的概念轉成具體可應用的成品或素材。我們可以讓AI幫我們說故事,豐富我們所要呈現的內容,並幫助我們傳達。