如何設計壹個優秀的數據庫

數據庫設計(Database Design)是指對於壹個給定的應用環境，構造最優的數據庫模式，建立數據庫及其應用系統，使之能夠有效地存儲數據，滿足各種用戶的應用需求（信息要求和處理要求）。在數據庫領域內，常常把使用數據庫的各類系統統稱為數據庫數據庫設計(database design)是指對於壹個給定的應用環境，構造最優的數據庫模式，建立數據庫及其應用系統，使之能夠有效地存儲數據，滿足各種用戶的應用需求（信息要求和處理要求）。在數據庫領域內，常常把使用數據庫的各類系統統稱為數據庫應用系統。壹、數據庫和信息系統 (1)數據庫是信息系統的核心和基礎，把信息系統中大量的數據按壹定的模型組織起來，提供存儲、維護、檢索數據的功能，使信息系統可以方便、及時、準確地從數據庫中獲得所需的信息。 (2)數據庫是信息系統的各個部分能否緊密地結合在壹起以及如何結合的關鍵所在。 (3)數據庫設計是信息系統開發和建設的重要組成部分。 (4)數據庫設計人員應該具備的技術和知識：數據庫的基本知識和數據庫設計技術計算機科學的基礎知識和程序設計的方法和技巧軟件工程的原理和方法應用領域的知識二、數據庫設計的特點數據庫建設是硬件、軟件和幹件的結合三分技術，七分管理，十二分基礎數據技術與管理的界面稱之為“幹件” 數據庫設計應該與應用系統設計相結合結構（數據）設計：設計數據庫框架或數據庫結構行為（處理）設計：設計應用程序、事務處理等結構和行為分離的設計傳統的軟件工程忽視對應用中數據語義的分析和抽象，只要有可能就盡量推遲數據結構設計的決策早期的數據庫設計致力於數據模型和建模方法研究，忽視了對行為的設計如圖：三、數據庫設計方法簡述手工試湊法設計質量與設計人員的經驗和水平有直接關系缺乏科學理論和工程方法的支持，工程的質量難以保證數據庫運行壹段時間後常常又不同程度地發現各種問題，增加了維護代價規範設計法手工設計方基本思想過程叠代和逐步求精規範設計法(續) 典型方法： (1)新奧爾良（new orleans）方法：將數據庫設計分為四個階段 s.b.yao方法：將數據庫設計分為五個步驟 i.r.palmer方法：把數據庫設計當成壹步接壹步的過程 (2)計算機輔助設計 oracle designer 2000 sybase powerdesigner 四、數據庫設計的基本步驟數據庫設計的過程(六個階段) 1.需求分析階段準確了解與分析用戶需求（包括數據與處理）是整個設計過程的基礎，是最困難、最耗費時間的壹步 2.概念結構設計階段是整個數據庫設計的關鍵通過對用戶需求進行綜合、歸納與抽象，形成壹個獨立於具體dbms的概念模型 3.邏輯結構設計階段將概念結構轉換為某個dbms所支持的數據模型對其進行優化 4.數據庫物理設計階段為邏輯數據模型選取壹個最適合應用環境的物理結構（包括存儲結構和存取方法） 5.數據庫實施階段運用dbms提供的數據語言、工具及宿主語言，根據邏輯設計和物理設計的結果建立數據庫，編制與調試應用程序，組織數據入庫，並進行試運行 6.數據庫運行和維護階段數據庫應用系統經過試運行後即可投入正式運行。在數據庫系統運行過程中必須不斷地對其進行評價、調整與修改設計特點: 在設計過程中把數據庫的設計和對數據庫中數據處理的設計緊密結合起來將這兩個方面的需求分析、抽象、設計、實現在各個階段同時進行，相互參照，相互補充，以完善兩方面的設計設計過程各個階段的設計描述：如圖：五、數據庫各級模式的形成過程 1.需求分析階段：綜合各個用戶的應用需求 2.概念設計階段：形成獨立於機器特點，獨立於各個dbms產品的概念模式(e-r圖) 3.邏輯設計階段：首先將e-r圖轉換成具體的數據庫產品支持的數據模型，如關系模型，形成數據庫邏輯模式；然後根據用戶處理的要求、安全性的考慮，在基本表的基礎上再建立必要的視圖(view)，形成數據的外模式 4.物理設計階段：根據dbms特點和處理的需要，進行物理存儲安排，建立索引，形成數據庫內模式六、數據庫設計技巧 1. 設計數據庫之前（需求分析階段） 1) 理解客戶需求，詢問用戶如何看待未來需求變化。讓客戶解釋其需求，而且隨著開發的繼續，還要經常詢問客戶保證其需求仍然在開發的目的之中。 2) 了解企業業務可以在以後的開發階段節約大量的時間。 3) 重視輸入輸出。在定義數據庫表和字段需求（輸入）時，首先應檢查現有的或者已經設計出的報表、查詢和視圖（輸出）以決定為了支持這些輸出哪些是必要的表和字段。舉例：假如客戶需要壹個報表按照郵政編碼排序、分段和求和，妳要保證其中包括了單獨的郵政編碼字段而不要把郵政編碼糅進地址字段裏。 4) 創建數據字典和er 圖表 er 圖表和數據字典可以讓任何了解數據庫的人都明確如何從數據庫中獲得數據。er圖對表明表之間關系很有用，而數據字典則說明了每個字段的用途以及任何可能存在的別名。對sql 表達式的文檔化來說這是完全必要的。 5) 定義標準的對象命名規範數據庫各種對象的命名必須規範。 2. 表和字段的設計（數據庫邏輯設計）表設計原則 1) 標準化和規範化數據的標準化有助於消除數據庫中的數據冗余。標準化有好幾種形式，但third normal form（3nf）通常被認為在性能、擴展性和數據完整性方面達到了最好平衡。簡單來說，遵守3nf 標準的數據庫的表設計原則是：“one fact in one place”即某個表只包括其本身基本的屬性，當不是它們本身所具有的屬性時需進行分解。表之間的關系通過外鍵相連接。它具有以下特點：有壹組表專門存放通過鍵連接起來的關聯數據。舉例：某個存放客戶及其有關定單的3nf 數據庫就可能有兩個表：customer 和order。order 表不包含定單關聯客戶的任何信息，但表內會存放壹個鍵值，該鍵指向customer 表裏包含該客戶信息的那壹行。事實上，為了效率的緣故，對表不進行標準化有時也是必要的。 2) 數據驅動采用數據驅動而非硬編碼的方式，許多策略變更和維護都會方便得多，大大增強系統的靈活性和擴展性。舉例，假如用戶界面要訪問外部數據源（文件、xml 文檔、其他數據庫等），不妨把相應的連接和路徑信息存儲在用戶界面支持表裏。還有，如果用戶界面執行工作流之類的任務（發送郵件、打印信箋、修改記錄狀態等），那麽產生工作流的數據也可以存放在數據庫裏。角色權限管理也可以通過數據驅動來完成。事實上，如果過程是數據驅動的，妳就可以把相當大的責任推給用戶，由用戶來維護自己的工作流過程。 3) 考慮各種變化在設計數據庫的時候考慮到哪些數據字段將來可能會發生變更。舉例，姓氏就是如此（註意是西方人的姓氏，比如女性結婚後從夫姓等）。所以，在建立系統存儲客戶信息時，在單獨的壹個數據表裏存儲姓氏字段，而且還附加起始日和終止日等字段，這樣就可以跟蹤這壹數據條目的變化。字段設計原則 4) 每個表中都應該添加的3 個有用的字段 drecordcreationdate，在vb 下默認是now()，而在sql server ? 下默認為getdate() srecordcreator，在sql server 下默認為not null default ? user nrecordversion，記錄的版本標記；有助於準確說明記錄中出現null 數據或者丟失數據的原因 ? 5) 對地址和電話采用多個字段描述街道地址就短短壹行記錄是不夠的。address_line1、address_line2 和address_line3 可以提供更大的靈活性。還有，電話號碼和郵件地址最好擁有自己的數據表，其間具有自身的類型和標記類別。 6) 使用角色實體定義屬於某類別的列在需要對屬於特定類別或者具有特定角色的事物做定義時，可以用角色實體來創建特定的時間關聯關系，從而可以實現自我文檔化。舉例：用person 實體和person_type 實體來描述人員。比方說，當john smith, engineer 提升為john smith, director 乃至最後爬到john smith, cio 的高位，而所有妳要做的不過是改變兩個表person 和person_type 之間關系的鍵值，同時增加壹個日期/時間字段來知道變化是何時發生的。這樣，妳的person_type 表就包含了所有person 的可能類型，比如associate、engineer、director、cio 或者ceo 等。還有個替代辦法就是改變person 記錄來反映新頭銜的變化，不過這樣壹來在時間上無法跟蹤個人所處位置的具體時間。 7) 選擇數字類型和文本類型盡量充足在sql 中使用smallint 和tinyint 類型要特別小心。比如，假如想看看月銷售總額，總額字段類型是smallint，那麽，如果總額超過了$32,767 就不能進行計算操作了。而id 類型的文本字段，比如客戶id 或定單號等等都應該設置得比壹般想象更大。假設客戶id 為10 位數長。那妳應該把數據庫表字段的長度設為12 或者13 個字符長。但這額外占據的空間卻無需將來重構整個數據庫就可以實現數據庫規模的增長了。 8) 增加刪除標記字段在表中包含壹個“刪除標記”字段，這樣就可以把行標記為刪除。在關系數據庫裏不要單獨刪除某壹行；最好采用清除數據程序而且要仔細維護索引整體性。 3. 選擇鍵和索引（數據庫邏輯設計）鍵選擇原則： 1) 鍵設計4 原則為關聯字段創建外鍵。 ? 所有的鍵都必須唯壹。 ? 避免使用復合鍵。 ? 外鍵總是關聯唯壹的鍵字段。 ? 2) 使用系統生成的主鍵設計數據庫的時候采用系統生成的鍵作為主鍵，那麽實際控制了數據庫的索引完整性。這樣，數據庫和非人工機制就有效地控制了對存儲數據中每壹行的訪問。采用系統生成鍵作為主鍵還有壹個優點：當擁有壹致的鍵結構時，找到邏輯缺陷很容易。 3) 不要用用戶的鍵(不讓主鍵具有可更新性) 在確定采用什麽字段作為表的鍵的時候，可壹定要小心用戶將要編輯的字段。通常的情況下不要選擇用戶可編輯的字段作為鍵。 4) 可選鍵有時可做主鍵把可選鍵進壹步用做主鍵，可以擁有建立強大索引的能力。索引使用原則：索引是從數據庫中獲取數據的最高效方式之壹。95%的數據庫性能問題都可以采用索引技術得到解決。 1) 邏輯主鍵使用唯壹的成組索引，對系統鍵（作為存儲過程）采用唯壹的非成組索引，對任何外鍵列采用非成組索引。考慮數據庫的空間有多大，表如何進行訪問，還有這些訪問是否主要用作讀寫。 2) 大多數數據庫都索引自動創建的主鍵字段，但是可別忘了索引外鍵，它們也是經常使用的鍵，比如運行查詢顯示主表和所有關聯表的某條記錄就用得上。 3) 不要索引memo/note 字段，不要索引大型字段（有很多字符），這樣作會讓索引占用太多的存儲空間。 4) 不要索引常用的小型表不要為小型數據表設置任何鍵，假如它們經常有插入和刪除操作就更別這樣作了。對這些插入和刪除操作的索引維護可能比掃描表空間消耗更多的時間。 4. 數據完整性設計（數據庫邏輯設計） 1) 完整性實現機制：實體完整性：主鍵參照完整性：父表中刪除數據：級聯刪除；受限刪除；置空值父表中插入數據：受限插入；遞歸插入父表中更新數據：級聯更新；受限更新；置空值 dbms對參照完整性可以有兩種方法實現：外鍵實現機制（約束規則）和觸發器實現機制用戶定義完整性： not null；check；觸發器 2) 用約束而非商務規則強制數據完整性采用數據庫系統實現數據的完整性。這不但包括通過標準化實現的完整性而且還包括數據的功能性。在寫數據的時候還可以增加觸發器來保證數據的正確性。不要依賴於商務層保證數據完整性；它不能保證表之間（外鍵）的完整性所以不能強加於其他完整性規則之上。 3) 強制指示完整性在有害數據進入數據庫之前將其剔除。激活數據庫系統的指示完整性特性。這樣可以保持數據的清潔而能迫使開發人員投入更多的時間處理錯誤條件。 4) 使用查找控制數據完整性控制數據完整性的最佳方式就是限制用戶的選擇。只要有可能都應該提供給用戶壹個清晰的價值列表供其選擇。這樣將減少鍵入代碼的錯誤和誤解同時提供數據的壹致性。某些公***數據特別適合查找：國家代碼、狀態代碼等。 5) 采用視圖為了在數據庫和應用程序代碼之間提供另壹層抽象，可以為應用程序建立專門的視圖而不必非要應用程序直接訪問數據表。這樣做還等於在處理數據庫變更時給妳提供了更多的自由。 5. 其他設計技巧 1) 避免使用觸發器觸發器的功能通常可以用其他方式實現。在調試程序時觸發器可能成為幹擾。假如妳確實需要采用觸發器，妳最好集中對它文檔化。 2) 使用常用英語（或者其他任何語言）而不要使用編碼在創建下拉菜單、列表、報表時最好按照英語名排序。假如需要編碼，可以在編碼旁附上用戶知道的英語。 3) 保存常用信息讓壹個表專門存放壹般數據庫信息非常有用。在這個表裏存放數據庫當前版本、最近檢查/修復（對access）、關聯設計文檔的名稱、客戶等信息。這樣可以實現壹種簡單機制跟蹤數據庫，當客戶抱怨他們的數據庫沒有達到希望的要求而與妳聯系時，這樣做對非客戶機/服務器環境特別有用。 4) 包含版本機制在數據庫中引入版本控制機制來確定使用中的數據庫的版本。時間壹長，用戶的需求總是會改變的。最終可能會要求修改數據庫結構。把版本信息直接存放到數據庫中更為方便。 5) 編制文檔對所有的快捷方式、命名規範、限制和函數都要編制文檔。采用給表、列、觸發器等加註釋的數據庫工具。對開發、支持和跟蹤修改非常有用。對數據庫文檔化，或者在數據庫自身的內部或者單獨建立文檔。這樣，當過了壹年多時間後再回過頭來做第2 個版本，犯錯的機會將大大減少。 6) 測試、測試、反復測試建立或者修訂數據庫之後，必須用用戶新輸入的數據測試數據字段。最重要的是，讓用戶進行測試並且同用戶壹道保證選擇的數據類型滿足商業要求。測試需要在把新數據庫投入實際服務之前完成。 7) 檢查設計在開發期間檢查數據庫設計的常用技術是通過其所支持的應用程序原型檢查數據庫。換句話說，針對每壹種最終表達數據的原型應用，保證妳檢查了數據模型並且查看如何取出數據。