百度面試題，如何快速找出文件(大文件無法一次性讀取)中的重復(fù)項(xiàng)？

百度面試題，大致意思是說，有個(gè)文件，文件很大不能一次性讀?。赡苁遣荒芤淮涡约虞d到內(nèi)存中），文件中存放的是IP地址，如何快速找出重復(fù)的IP地址？求指點(diǎn)思路。

文件很大，可以逐行讀取，append到list中，取set，再取差集，不知是否可行？

回答

編輯回答

怪痞

IPv4么…… 一共才 4Gi 個(gè)地址，到內(nèi)存里挖好坑，等著IP來跳。浪費(fèi)點(diǎn)，用int8來存也就是4GB內(nèi)存，節(jié)省點(diǎn)，用bit存的話只要500MB。思路可以活點(diǎn)，其實(shí)我覺得給出IP地址這個(gè)限制條件就是在降低難度。

IPv6的話，可能就得分治?；舅悸肪褪窍劝磧?nèi)存能承受的長度去檢查地址的前幾位，碰撞了的丟同一個(gè)bucket里，然后再一個(gè)一個(gè)bucket地去看里面有沒有重的，往下也可以再分。其實(shí)DBMS整天干這事……

2017年3月8日 06:17

編輯回答

離魂曲

不可行。

append 到 list中，，跟直接一次性讀取沒差，都是要占用所有數(shù)據(jù)的內(nèi)存；
取差集只能set - list，不能 list - set

2018年7月1日 14:06

編輯回答

故林

條件不充分阿。如果有1000萬條記錄地址，只有幾個(gè)重復(fù)，目前想到的可以先排序，然后map-reduce。如果有1000萬條記錄，其中900萬是重復(fù)的，用hashTable就解決了。

2017年9月8日 09:52

編輯回答

陪她鬧

首先把ip轉(zhuǎn)成int(網(wǎng)上一堆算法請百度)
然后做一個(gè)大的數(shù)組
比如192.168.3.4轉(zhuǎn)換后為3232236292
對應(yīng)的數(shù)組為 int array[3232236292-1]做計(jì)數(shù)即可
再簡化一下，由于數(shù)組要預(yù)先分配，這里用map就行

2018年8月20日 12:30

相關(guān)信息

熱門機(jī)構(gòu)

北大青鳥昌平沙河校區(qū)

北大青鳥APTECH成立于1999年。依托北京大學(xué)優(yōu)質(zhì)雄厚的教育資源和背景，秉承“教育改變生活”的發(fā)展理念，致力于培養(yǎng)中國IT技能型緊缺人才，是大數(shù)據(jù)專業(yè)的國家
北大青鳥中博軟件學(xué)院

北大青鳥中博軟件學(xué)院創(chuàng)立于2003年，作為華東區(qū)著名互聯(lián)網(wǎng)學(xué)院和江蘇省首批服務(wù)外包人才培訓(xùn)基地，中博成功培育了近30000名軟件工程師走向高薪崗位，合作企業(yè)超4
中公教育IT品牌優(yōu)就業(yè)

中公教育集團(tuán)創(chuàng)建于1999年，經(jīng)過二十年潛心發(fā)展，已由一家北大畢業(yè)生自主創(chuàng)業(yè)的信息技術(shù)與教育服務(wù)機(jī)構(gòu)，發(fā)展為教育服務(wù)業(yè)的綜合性企業(yè)集團(tuán)，成為集合面授教學(xué)培訓(xùn)、網(wǎng)
達(dá)內(nèi)教育

達(dá)內(nèi)教育集團(tuán)成立于2002年，是一家由留學(xué)海歸創(chuàng)辦的高端職業(yè)教育培訓(xùn)機(jī)構(gòu)，是中國一站式人才培養(yǎng)平臺(tái)、一站式人才輸送平臺(tái)。2014年4月3日在美國成功上市，融資1

熱門課程

北大青鳥android課程

適合人群：大專以上學(xué)歷

開班時(shí)間：每月1號(hào)
北大青鳥java軟件工程師

適合人群：大學(xué)畢業(yè)生

開班時(shí)間：每月1號(hào)
北大青鳥ACCP初中課程

適合人群：初中以上學(xué)歷

開班時(shí)間：每月1號(hào)
北大青鳥大數(shù)據(jù)課程

適合人群：18歲以上人群

開班時(shí)間：每月1號(hào)

熱門教師

劉國斌Java講師

曾工作于聯(lián)想擔(dān)任系統(tǒng)開發(fā)工程師，曾在博彥科技股份有限公司擔(dān)任項(xiàng)目經(jīng)理從事移動(dòng)互聯(lián)網(wǎng)管理及研發(fā)工作，曾創(chuàng)辦藍(lán)懿科技有限責(zé)任公司從事總經(jīng)理職務(wù)負(fù)責(zé)iOS教學(xué)及管理工作。
王克晶Java講師

浪潮集團(tuán)項(xiàng)目經(jīng)理。精通Java與.NET 技術(shù)，熟練的跨平臺(tái)面向?qū)ο箝_發(fā)經(jīng)驗(yàn)，技術(shù)功底深厚。授課風(fēng)格授課風(fēng)格清新自然、條理清晰、主次分明、重點(diǎn)難點(diǎn)突出、引人入勝。
張老師web前端講師

精通HTML5和CSS3；Javascript及主流js庫，具有快速界面開發(fā)的能力，對瀏覽器兼容性、前端性能優(yōu)化等有深入理解。精通網(wǎng)頁制作和網(wǎng)頁游戲開發(fā)。
劉蒼松Java教研總監(jiān)

具有10 年的Java 企業(yè)應(yīng)用開發(fā)經(jīng)驗(yàn)。曾經(jīng)歷任德國Software AG 技術(shù)顧問，美國Dachieve 系統(tǒng)架構(gòu)師，美國AngelEngineers Inc. 系統(tǒng)架構(gòu)師。

熱門資訊

熱門城市

熱門教程

熱門問題

百度面試題，如何快速找出文件(大文件無法一次性讀取)中的重復(fù)項(xiàng)？

相關(guān)信息

劉國斌Java講師

王克晶Java講師

張老師web前端講師

劉蒼松Java教研總監(jiān)

百度面試題，如何快速找出文件(大文件無法一次性讀取)中的重復(fù)項(xiàng)？