社會科學的文本分析: R的應用

社會科學的文本分析: R的應用

出版日期:
2025/08/24
79
420331
查詢門市庫存
⊙系統化學習路徑
從文本分析基礎概念、語料庫結構探索、文本資料視覺化,到聚類辨識文本相似性、情感分析與機器學習,循序漸進,逐步搭建完整框架。
⊙理論結合實作
透過豐富案例與步驟式操作指南,引導讀者使用R及quanteda等套件,立即動手建立可複製的文本分析工作流程。

內容簡介

⊙系統化學習路徑
從文本分析基礎概念、語料庫結構探索、文本資料視覺化,到聚類辨識文本相似性、情感分析與機器學習,循序漸進,逐步搭建完整框架。
⊙理論結合實作
透過豐富案例與步驟式操作指南,引導讀者使用R及quanteda等套件,立即動手建立可複製的文本分析工作流程。
⊙橫跨社科、文學與商業
聚焦「以問題為導向」的應用場景,協助研究者與實務工作者有效解讀文本數據,洞察人類行為與社會脈動。

     在數據驅動的時代,文本分析是揭示人類語言奧祕的關鍵方法。本書以R與quanteda生態系為核心,示範如何從語料庫中挖掘模式、趨勢與洞見,助力學術研究,也為政策、商業與社會決策提供實證基礎。
  全書循序漸進:
1. 語料庫結構與預處理:分詞、N-gram、TF-IDF等基礎技術。
2. 聚類與相似性分析:以階層與K-means等方法刻畫文本關係。
3. 情感分析與機器學習:結合SVM、隨機森林等模型,完成精細分類與預測。
     每章均附完整R程式碼、真實案例與圖形化流程,讀者可即學即用,迅速將方法轉化為學術或業界成果。

展開看更多

產品目錄

第1章 文本分析簡介
什麼是文本分析?
透過文本洞察力提取數據
結語
文本分析工作流程
 原始文本
 矩陣表示
 分析
準備:練習使用R進行文本分析
 步驟1:載入quanteda套件
 步驟2:使用print()探索語料庫
 步驟3:使用tokens()對語料庫進行字元化處理
 步驟4:使用dfm()創建文檔-特徵矩陣
 步驟 5:使用textplot_wordcloud()創建文字雲
第1章總結

第2章 探索語料庫的結構
 步驟1:載入quanteda
 步驟2:檢視語料庫並提取文件變數
 步驟3:使用SOTU語料庫重現分析
詞彙字元化
 步驟1:載入quanteda
 步驟2:對語料庫進行詞彙字元化處理
 步驟3:使用kwic()探索字元化的語料庫
在R中創建文檔-特徵矩陣
 步驟1:載入quanteda
 步驟2:對語料庫進行字元化處理
 步驟3:創建文檔-特徵矩陣
 步驟4:選擇dfm特徵
第2章總結

第3章 文本數據的視覺化呈現
條形圖
詞彙分布圖
關鍵度繪圖
相關描述性統計
摘要統計
 頻率
 可讀性
 詞彙多樣性
關鍵詞分析
 步驟1:載入套件
 步驟2:對語料庫進行字元化處理
 步驟3:創建文檔-特徵矩陣
 步驟4:執行命令獲取摘要統計資料
 步驟5:將匯總統計資料轉換為相關的視覺化圖形
第3章總結

第4章 在R中應用聚類技術識別文本相似性
視覺化聚類算法
K-均值聚類
 選擇一個K值
 手肘法
 層次聚類
 終止點的確認
 樹狀圖
 方法比較
計算R中的二元統計量
 步驟1:加載套件和語料庫
 步驟2:字元化並創建文檔-特徵矩陣
 步驟3:使用textstat_simil()進行相似度計算
 步驟4:使用textstat_dist()進行距離計算
聚類美國總統演講
 步驟1:加載套件和語料庫
 步驟2:字元化並創建文檔-特徵矩陣
 步驟3:K-均值聚類和層次聚類
 繪製距離和K-均值聚類
繪製層次聚類
第4章總結

第5章 情感分析
情感分析工作流程
執行情感分析
 步驟1:載入和探索語料庫
 步驟2:對資料進行字元化
 步驟3:識別極端文本中最常見的單詞
 步驟4:應用情感詞典進行情感分析
 步驟5:情感分析
 步驟6:視覺化
第5章總結

第6章 機器學習
分類的應用案例
單純貝氏分類模型
線性支援向量機(Linear Support Vector Machines)
混淆矩陣(Confusion Matrix)
評估R中的分類模型
 步驟1:載入套件和語料庫
 步驟2:對資料進行字元化並創建dfm
 步驟3:創建訓練集和測試集
 步驟4:擬合單純貝氏分類器
 步驟5:進行準確性測試
 步驟6:進行交叉驗證
第6章總結

第7章 結論與未來研究展望
旅程回顧
實踐之旅
展望未來
第7章總結

第8章 附件:R指令整理
第1章:文本分析簡介
 1. 基本操作函數
 2. quanteda套件函數
第2章:探索語料庫的結構
 1. 語料庫處理
 2. 字元化處理
 3. 關鍵詞文脈分析(KWIC)
 4. 文檔-特徵矩陣(DFM)
 5. 其他分析與應用
第3章:文本數據的視覺化呈現
 1. 文字雲相關函數
 2. 條形圖與相關統計函數
 3. 詞彙分布與關鍵度繪圖函數
 4. 可視化繪圖函數
第4章:在R中應用聚類技術識別文本相似性
 1. 文本預處理相關函數
 2. 相似性與距離計算函數
 3. K-均值聚類相關函數
 4. 層次聚類相關函數
 5. 視覺化繪圖相關函數
第5章:情感分析
 1. 載入與探索語料庫相關指令
 2. 資料字元化相關指令
 3. 文檔-特徵矩陣(DFM)操作相關指令
 4. 關鍵字和文字雲相關指令
 5. 情感詞典相關指令
 6. 資料框轉換與操作指令
 7. 視覺化相關指令
第6章:機器學習
 1. 載入與探索數據相關指令
 2. 資料分割與訓練測試集相關指令
 3. 單純貝氏分類相關指令
 4. 支援向量機(SVM)相關指令
 5. 模型性能評估相關指令
 6. 交叉驗證相關指令
 7. 可視化相關指令

作者介紹

曾文鐽

現職:
國立臺灣科技大學應用外語系教授

學歷:
英國諾丁漢大學博士

經歷:
國立臺灣師範大學英語系助理教授、副教授
國立臺灣科技大學應用外語系副教授

規格

誠品貨碼 / 2682988592005
ISBN13 / 9786264237017
ISBN10 /
EAN貨碼 / 9786264237017
頁數 / 196
裝訂 / P:平裝
語言 / 1:中文/繁體
尺寸 / 26*19*0.98
級別 / N:無
重量(g) / 430
提供維修 / 無

退貨說明

退貨須知:

  1. 依照消費者保護法的規定,您享有商品貨到次日起七天猶豫期(含例假日)的權益(請注意!猶豫期非試用期),辦理退貨之商品必須是全新狀態(不得有刮傷、破損、受潮)且需完整(包含全部商品、配件、原廠內外包裝、贈品及所有附隨文件或資料的完整性等)。
  2. 請您以送貨廠商使用之包裝紙箱將退貨商品包裝妥當,若原紙箱已遺失,請另使用其他紙箱包覆於商品原廠包裝之外,切勿直接於原廠包裝上黏貼紙張或書寫文字。若原廠包裝損毀將可能被認定為已逾越檢查商品之必要程度,本公司得依毀損程度扣除回復原狀必要費用(整新費)後退費;請您先確認商品正確、外觀可接受,再行拆封,以免影響您的權利;若為產品瑕疵,本公司接受退貨。

依「通訊交易解除權合理例外情事適用準則」,下列商品不適用七日猶豫期,除產品本身有瑕疵外,不接受退貨:

  1. 易於腐敗、保存期限較短或解約時即將逾期。(如:生鮮蔬果、乳製品、冷凍冷藏食材、蛋糕)
  2. 依消費者要求所為之客製化給付。(如:客製印章、鋼筆刻字)
  3. 報紙、期刊或雜誌。
  4. 經消費者拆封之影音商品或電腦軟體。
  5. 非以有形媒介提供之數位內容或一經提供即為完成之線上服務,經消費者事先同意始提供。(如:電子書)
  6. 已拆封之個人衛生用品。(如:內衣褲、襪類、褲襪、刮鬍刀、除毛刀等貼身用品)
  7. 國際航空客運服務。

若您退貨時有下列情形,可能被認定已逾越檢查商品之必要程度而須負擔為回復原狀必要費用(整新費),或影響您的退貨權利,請您在拆封前決定是否要退貨:

  1. 以數位或電磁紀錄形式儲存或著作權相關之商品(包含但不限於CD、VCD、DVD、電腦軟體等) 包裝已拆封者(除運送用之包裝以外)。
  2. 耗材(包含但不限於墨水匣、碳粉匣、紙張、筆類墨水、清潔劑補充包等)之商品包裝已拆封者(除運送用之包裝以外)。
  3. 衣飾鞋類/寢具/織品(包含但不限於衣褲、鞋子、襪子、泳裝、床單、被套、填充玩具)或之商品缺件(含購買商品、附件、內外包裝、贈品等)或經剪標或下水或商品有不可回復之髒污或磨損痕跡。
  4. 食品、美容/保養用品、內衣褲等消耗性或個人衛生用品、商品銷售頁面上特別載明之商品已拆封者(除運送用之包裝外一切包裝、包括但不限於瓶蓋、封口、封膜等接觸商品內容之包裝部分)或已非全新狀態(外觀有刮傷、破損、受潮等)與包裝不完整(缺少商品、附件、原廠外盒、保護袋、配件紙箱、保麗龍、隨貨文件、贈品等)。
  5. 家電、3C、畫作、電子閱讀器等商品,除商品本身有瑕疵外,退回之商品已拆封(除運送用之包裝外一切包裝、包括但不限於封膜等接觸商品內容之包裝部分、移除封條、拆除吊牌、拆除貼膠或標籤等情形)或已非全新狀態(外觀有刮傷、破損、受潮等)與包裝不完整(缺少商品、附件、原廠外盒、保護袋、配件紙箱、保麗龍、隨貨文件、贈品等)。
  6. 退貨程序請參閱【客服專區→常見問題→誠品線上退貨退款】之說明。
付款/配送